Table of Contents
Statistics
1675 words
8 minutes
高中数学_成对数据统计分析知识点留档
高中数学成对数据统计分析知识点留档
首先感谢我的数学老师
一、两个变量的相关关系
1. 变量关系分类
根据两个变量之间的关系,可分为:
- 函数关系
- 相关关系
- 不相关
根据两个变量的变化趋势,可分为:
- 正相关
- 负相关
2. 核心概念
- 相关关系:两个变量有关系,但没有确切到可由其中一个精确地决定另一个的程度。
- 线性相关:两个变量的取值呈正相关或负相关,且散点落在一条直线附近。
- 非线性相关(曲线相关):两个变量具有相关性,但不是线性相关。
3. 线性相关判断方法
- 散点图
- 样本相关系数 r
4. 协方差公式
Lxy=n1i=1∑n(xi−xˉ)(yi−yˉ)- 作用:对“中心化”的数据取平均值
- 符号意义:Lxy>0 正相关;Lxy<0 负相关
5. 样本相关系数
通过对样本数据的中心化、标准化,得到样本相关系数 r:
r=∑i=1n(xi−xˉ)2∑i=1n(yi−yˉ)2∑i=1n(xi−xˉ)(yi−yˉ)=∑i=1nxi2−nxˉ2∑i=1nyi2−nyˉ2∑i=1nxiyi−nxˉyˉ(会推导公式的变形)
- 取值范围:[−1,1]
- r=0:成对样本数据间没有线性相关关系,但不排除它们之间有其他相关关系
- ∣r∣ 越接近 1:样本数据的线性相关程度越强
- r>0:成对样本数据正相关
- ∣r∣>0.75时可认为相关程度强
6.样本相关系数 r 推导
- 标准化变换
对数据进行中心化、标准化处理:
xi′=sxxi−xˉ,yi′=syyi−yˉ其中样本标准差:
sx=n1i=1∑n(xi−xˉ)2,sy=n1i=1∑n(yi−yˉ)2构造向量:
α=(x1′,x2′,…,xn′),β=(y1′,y2′,…,yn′)- 向量内积与夹角
向量内积公式:
α⋅β=∣α∣∣β∣cosθ- 计算向量模长:
同理 ∣β∣=n。
- 计算内积:
- 相关系数的几何意义
样本相关系数定义:
r=∑i=1n(xi−xˉ)2∑i=1n(yi−yˉ)2∑i=1n(xi−xˉ)(yi−yˉ)=sxsyn1∑i=1n(xi−xˉ)(yi−yˉ)代入内积公式:
r=n1α⋅β=n1∣α∣∣β∣cosθ=cosθ因此 r=cosθ∈[−1,1]。
二、经验回归方程
1. 最小二乘法思想
从整体上看,各点与直线的距离最小,该方法叫最小二乘法。
2. 经验回归直线方程
经验回归直线方程 y^=b^x+a^ 中:
b^=∑i=1n(xi−xˉ)2∑i=1n(xi−xˉ)(yi−yˉ)=∑i=1nxi2−nxˉ2∑i=1nxiyi−nxˉyˉa^=yˉ−b^xˉ3. 核心性质
- 经验回归直线方程一定过点 样本中心 (xˉ,yˉ)
- b^ 与 r 的正负相关性:b^>0,r>0 正相关;b^<0,r<0 负相关
- 当 x 增大一个单位时,y^ 平均增大 b^ 个单位
4. 观测值与预测值
- 观测值:通过观测得到的数据 yi
- 预测值:通过经验回归方程得到的 y^i
- 残差:ei=yi−y^i
Note记忆法:关羽(观预)
5. 残差图
- 绘制方法:横坐标为数据,纵坐标为残差
- 拟合效果好的特征:残差均匀地分布在以取值为0的横轴为对称轴的水平带状区域内
6. 非线性回归方程
以 y=cegx 为例,通过换元将其转化为线性回归:
lny=lnc+gx7. 决定系数
R2=1−∑i=1n(yi−yˉ)2∑i=1n(yi−y^i)2- R2 越大,表示残差平方和越小,模型的拟合效果越好
8. 拟合效果判断方法
- 一元线性回归模型:相关系数 r、决定系数 R2、残差图
- 非线性回归模型:决定系数 R2、残差图
9.回归系数 b^,a^ 的推导
- 残差平方和定义
设经验回归方程为 y^=bx+a,残差平方和:
Q(a,b)=i=1∑n(yi−bxi−a)2- 配方变形
利用 yˉ=bxˉ+a,对 yi−bxi−a 拆分:
yi−bxi−a=(yi−yˉ)−b(xi−xˉ)+(yˉ−bxˉ)−a=[(yi−yˉ)−b(xi−xˉ)]+[(yˉ−bxˉ)−a]代入 Q(a,b) 展开:
Q(a,b)=i=1∑n{[(yi−yˉ)−b(xi−xˉ)]+[(yˉ−bxˉ)−a]}2=i=1∑n[(yi−yˉ)−b(xi−xˉ)]2+2[(yˉ−bxˉ)−a]i=1∑n[(yi−yˉ)−b(xi−xˉ)]+n[(yˉ−bxˉ)−a]2- 交叉项化简
由 ∑i=1n(xi−xˉ)=0,∑i=1n(yi−yˉ)=0,得:
i=1∑n[(yi−yˉ)−b(xi−xˉ)]=i=1∑n(yi−yˉ)−bi=1∑n(xi−xˉ)=0因此交叉项为0,残差平方和简化为:
Q(a,b)=i=1∑n[(yi−yˉ)−b(xi−xˉ)]2+n[(yˉ−bxˉ)−a]2- 求最小值
- 第二项 n[(yˉ−bxˉ)−a]2≥0,当且仅当 a=yˉ−bxˉ 时取最小值0,因此截距:
- 此时 Q(a,b) 仅与 b 有关,展开第一项:
这是关于 b 的二次函数,开口向上,最小值在顶点处取得:
b^=∑i=1n(xi−xˉ)2∑i=1n(xi−xˉ)(yi−yˉ)- 公式变形(展开验证)
展开分子 ∑i=1n(xi−xˉ)(yi−yˉ):
i=1∑n(xi−xˉ)(yi−yˉ)=i=1∑nxiyi−xˉi=1∑nyi−yˉi=1∑nxi+nxˉyˉ=i=1∑nxiyi−nxˉyˉ同理分母 ∑i=1n(xi−xˉ)2=∑i=1nxi2−nxˉ2,因此:
b^=∑i=1nxi2−nxˉ2∑i=1nxiyi−nxˉyˉ三、独立性检验
1. 分类变量
用以区别不同的现象或类别的随机变量。
2. 2×2列联表
给出了成对分类变量(用特殊随机变量区别不同现象与性质)数据的交叉分类频数:
| X \ Y | Y=0 | Y=1 | 合计 |
|---|---|---|---|
| X=0 | a | b | a+b |
| X=1 | c | d | c+d |
| 合计 | a+c | b+d | n=a+b+c+d |

3. 粗略判断 X 和 Y 是否有差异的方法
条件概率、等高堆积条形图

4. 独立性检验步骤
① 提出假设
零假设(原假设)H0:P(Y=1∣X=0)=P(Y=1∣X=1),即假设 X 与 Y 相互独立。
构造随机变量(卡方统计量):
χ2=(a+b)(c+d)(a+c)(b+d)n(ad−bc)2- χ2 较大:说明 H0 不成立
- χ2 较小:说明 H0 成立
② 临界值与检验规则
对任意小概率值 α,找到临界值 χα,满足 P(χ2≥χα)=α:
- α 越小,χα 越大
- α 充分小时,{χ2≥χα} 是不大可能发生的,若发生则可推断 H0 不成立(犯错概率不超过 α)
检验规则:
- 当 χ2≥χα 时,推断 H0 不成立,即认为 X 和 Y 不独立,犯错概率不超过 α
- 当 χ2<χα 时,没有充分证据推断 H0 不成立,可认为 X 和 Y 独立
③ 应用环节
- 提出零假设 H0:X 与 Y 相互独立
- 整理出 2×2 列联表,计算 χ2,并与临界值 χα 比较
- 推断结论
- 在 X 和 Y 不独立的情况下,通过比较相应的频率,分析 X 和 Y 间的影响规律