高中数学统计知识点留档
首先感谢我的数学老师
分布列、均值、方差
一、分布列
1. 随机变量
对于随机试验的样本空间Ω中的每个样本点ω,都有唯一的实数X(ω)与之对应,称X为随机变量。
注:
① 样本点-数量化:与数值有关的,直接对应;与数值没有直接关系的,赋值。
② 试验之前可列出所有值,但不能确定具体取值。
2. 离散型随机变量
随机变量取值为有限个或可以一一列举出来。
3. 求分布列的步骤
- 随机变量可能取值
- 每个取值的概率
- 列表
4. 分布列的性质
① pi≥0;② ∑ipi=1。
5. 均值(数学期望)
E(X)=∑ixipi
6. 方差
D(X)=∑i(xi−E(X))2pi=E(X2)−(E(X))2
NoteD(X)=E[(X−E(X))2]=E[X2−2X⋅E(X)+(E(X))2]=E(X2)−E[2X⋅E(X)]+E[(E(X))2]=E(X2)−2E(X)⋅E(X)+(E(X))2=E(X2)−2[E(X)]2+[E(X)]2=E(X2)−[E(X)]2
7. 期望与方差的运算性质
E(aX+b)=aE(X)+b;D(aX+b)=a2D(X)
8. 伯努利试验
- 伯努利试验:只包含两个可能结果的试验叫伯努利试验。
- n重伯努利实验:将一个伯努利试验独立地重复进行n次所组成的随机试验,叫n重伯努利实验。
二、常见分布列
1. 两点分布(0-1分布)
| X | 0 | 1 |
|---|---|---|
| P | 1−p | p |
E(X)=p;D(X)=p(1−p)
2. 二项分布
① 在n重伯努利试验中,设每次试验中事件A发生的概率为p,A发生的次数为X,则X服从二项分布,记作X∼B(n,p)。
② P(X=k)=Cnkpk(1−p)n−k(k=0,1,2,…,n)
③ E(X)=np;D(X)=np(1−p)(会推导)
④ 图像(以A出现次数为横坐标,概率为纵坐标)规律:
- 当p=0.5时,图像对称;
- 当p>0.5时,图像右偏;
- 当p<0.5时,图像左偏;
- k从0增到n,则P(X=k)先增后减。
NoteE(X)=k=0∑nk⋅P(X=k)=k=0∑nk⋅Cnkpk(1−p)n−k=k=1∑nk⋅k!(n−k)!n!pk(1−p)n−k=k=1∑n(k−1)!(n−k)!n!pk(1−p)n−k=npk=1∑n(k−1)!(n−k)!(n−1)!pk−1(1−p)(n−1)−(k−1)=npm=0∑n−1Cn−1mpm(1−p)(n−1)−m=np⋅[p+(1−p)]n−1=npE(X2)D(X)=k=0∑nk2⋅Cnkpk(1−p)n−k=npm=0∑n−1(m+1)Cn−1mpm(1−p)(n−1)−m=np[(n−1)p+1]=n(n−1)p2+np=E(X2)−[E(X)]2=n(n−1)p2+np−n2p2=np−np2=np(1−p)
3. 求最值:求P(X=k)的最大值的方法
- 作商法
- 不等式法: {P(X=k)≥P(X=k−1)P(X=k)≥P(X=k+1) 结论:(n+1)p−1≤k≤(n+1)p。
4. 超几何分布
① 一批产品共N件,其中M件次品,从N件中抽取n件,用X表示抽取的n件产品中的次品数,则X服从超几何分布。 ② P(X=k)=CNnCMkCN−Mn−k(k=m,m+1,…,r) ③ E(X)=nNM;D(X)=nNM(1−NM)N−1N−n
NoteE(X)=k∑k⋅CNnCMkCN−Mn−k=CNn1k∑kCMkCN−Mn−k=CNn1k∑MCM−1k−1CN−Mn−k=CNnMk∑CM−1k−1CN−Mn−k=CNnMt∑CM−1tCN−M(n−1)−t=CNnMCN−1n−1=n!(N−n)!N!M⋅(n−1)!(N−n)!(N−1)!=N!⋅(n−1)!(N−n)!M⋅n!(N−n)!⋅(N−1)!=NMnD(X)E[X(X−1)]D(X)=E(X2)−[E(X)]2=E[X(X−1)+X]−(NnM)2=E[X(X−1)]+E(X)−(NnM)2,=k∑k(k−1)⋅CNnCMkCN−Mn−k=CNn1k∑k(k−1)CMkCN−Mn−k=CNn1k∑M(M−1)CM−2k−2CN−Mn−k=CNnM(M−1)k∑CM−2k−2CN−Mn−k=CNnM(M−1)CN−2n−2=CNnM(M−1)⋅(n−2)!(N−n)!(N−2)!=N!⋅(n−2)!(N−n)!M(M−1)⋅(N−2)!⋅n!(N−n)!=N(N−1)n(n−1)M(M−1),=N(N−1)n(n−1)M(M−1)+NnM−N2n2M2=NnM[N−1(n−1)(M−1)+1−NnM]=NnM⋅N(N−1)N(n−1)(M−1)+N(N−1)−nM(N−1)=N2nM(N−M)⋅N−1N−n=NnM(1−NM)N−1N−n.
5. 超几何分布与二项分布的区分
- 原理:由古典概型得出超几何分布,由独立重复试验得出二项分布;
抽样方式:放回摸球是二项分布,不放回摸球是超几何分布;
近似情况:对于不放回摸球,当N充分大、且n远小于N时,各次抽样结果彼此影响很小,可近似认为独立,此时超几何分布可以用二项分布近似;
适用场景:当n较小时,用超几何分布处理;当n较大时,用二项分布近似。
近似二项分布的情况:- 频率替代概率
- 总体未给出或总体很大
- 事件独立且概率不变
- 对于同一个模型,两个分布的均值相等,但超几何分布的方差较小,说明这个分布中随机变量的取值更集中于均值附近。
6. 正态分布
① 若随机变量X的概率分布密度函数f(x)=2πσ1e−2σ2(x−μ)2,则称X服从正态分布,记作X∼N(μ,σ2)。
② 正态曲线的特点:
1° 曲线位于x轴上方,与x轴不相交;
2° 曲线是单峰的,关于x=μ对称,最高点坐标为(μ,2πσ1);
3° 曲线与x轴之间区域的面积为1;
4° σ越大,图象越“胖”;σ越小,图象越“瘦高”。
③ 概率公式:
P(μ−σ≤X≤μ+σ)=0.6827
P(μ−2σ≤X≤μ+2σ)=0.9545
P(μ−3σ≤X≤μ+3σ)=0.9973
随机抽样、数字特征
一、随机抽样
1. 统计学获取数据的途径
调查、试验、观察、查询
2. 调查方法
- 全面调查(普查)
- 普查所获数据更全面、系统,但费时费力、成本高
- 抽样调查
- 抽查获取信息不全面,但大量检验,尤其是破坏性试验,抽样更好
3. 常用的随机抽样方法
简单随机抽样,分层随机抽样
使用条件:总体是否由差异明显的几部分组成
4. 简单随机抽样的方法
- 抽签法:编号、制签、搅匀、抽签、取样
- 随机数法:编号、产生随机数、选号,选定样本
5. 不放回简单随机抽样的特征
有限性、逐一性、不放回性、等可能性
6. 分层随机抽样的考要点
分层、求比、求每层的样本空间、对每层进行简单随机抽样、定样
7. 分层随机抽样样本均值/方差公式
设第一层样本量为m,平均数为xˉ,方差为s12;第二层样本量为n,平均数为yˉ,方差为s22,样本总平均数为wˉ,则:
- 样本平均数: wˉ=m+nmxˉ+m+nnyˉ
- 样本方差: s2=m+nm[s12+(xˉ−wˉ)2]+m+nn[s22+(yˉ−wˉ)2]
Notes2=m+n1[i=1∑m(xi−wˉ)2+j=1∑n(yj−wˉ)2]=m+n1[i=1∑m(xi−xˉ+xˉ−wˉ)2+j=1∑n(yj−yˉ+yˉ−wˉ)2]=m+n1[i=1∑m(xi−xˉ)2+2(xˉ−wˉ)i=1∑m(xi−xˉ)+i=1∑m(xˉ−wˉ)2+j=1∑n(yj−yˉ)2+j=1∑n(yˉ−wˉ)2]=m+n1[ms12+2(xˉ−wˉ)(mxˉ−mxˉ)+m(xˉ−wˉ)2+ns22+j=1∑n(yˉ−wˉ)2]=m+n1[ms12+m(xˉ−wˉ)2+ns22+n(yˉ−wˉ)2]=m+nm[s12+(xˉ−wˉ)2]+m+nn[s22+(yˉ−wˉ)2]
8. 任意随机抽样中个体被抽到的概率
Nn
二、数字特征
1. 画频率分布直方图的步骤
① 求极差 ② 定组距与组数 ③ 将数据分组 ④ 列频率分布表 ⑤ 画图
频率分布直方图的纵坐标为组距频率 在图中,频率=组距×组距频率=小长方形的面积
2. 常用的统计图
条形图、折线图、扇形图、频率分布直方图、频数分布直方图
3. 第p百分位数的定义
它使得这组数据中至少有p%的数据小于或等于这个值,且至少有(100−p)%的数据大于或等于这个值。
4. 求n个数据的第p百分位数的步骤
① 从小到大排列原始数据
② 计算i=n×p%
③ 若i不是整数,而大于i的比邻整数为j(向上取整),则P分位数为第j项数据;
若i是整数,则P分位数为第i项与第i+1项数据的平均数。
5. 中位数与四分位数
- 中位数相当于第50百分位数
- 四分位数分别是第25百分位数、第50百分位数、第75百分位数
- 上四分位数是第75百分位数
Warning注意四分位数有3个
6. 平均数、中位数、极端值、方差的性质
- 平均数反映数据集中趋势,一数据的改变会影响平均数吗?会
- 中位数受极端值影响吗?不受
- 一组数据如何求中位数?从小到大排序,奇数个,为正中间的数;偶数个,为中间两数的平均数
- 方差反映数据离散程度 s2=n1∑i=1n(xi−xˉ)2=n1∑i=1nxi2−xˉ2
Notes2=n1i=1∑n(xi−xˉ)2=n1i=1∑n(xi2−2xixˉ+xˉ2)=n1(i=1∑nxi2−2xˉi=1∑nxi+nxˉ2)=n1i=1∑nxi2−2xˉ2+xˉ2=n1i=1∑nxi2−xˉ2
7. 平均数、中位数、众数的特点
- 在平均数、中位数、众数中,平均数、中位数是唯一的,众数一定是原数据中的数。
- 对数值型数据(如用水量、身高)集中趋势的描述,可以用平均数、中位数;
- 对分类型数据(如性别、校服规格)集中趋势的描述,可用众数。
8. 描述数据离散程度的统计量
方差、标准差、极差
9. 频率分布直方图中统计量求解
- 平均数:∑组中值×频率
- 第p百分位数:从左往右数,先数满格,不满的按比例补
Note第p百分位数=L+w⋅f0.01p−F
- 计算目标累计频率:0.01p
- 从左往右累加频率,找到首次累计频率 ≥ 0.01p 的那一组,记为:
- 左端点:L
- 组距:w
- 本组频率:f
- 前几组累计频率:F
- 公式:
- 中位数:第50百分位数
- 众数:最高一组的组中值(最高矩形底边中点横坐标)
- 方差
Notes2=∑(xi−xˉ)2fi其中:
- xi:各组组中值
- fi:各组频率
- xˉ:上面算出的平均数
Note一句话速记
- 众数:最高矩形中点
- 平均数:组中值×频率 相加
- 百分位数:累计频率插值
- 方差:(组中值−均值)²×频率 相加
10. 频率分布直方图形态与平均数、中位数的关系
在三种频率分布图形形态中,平均数与中位数的大小关系:

- 对称形态:平均数=中位数
- 右偏形态:中位数<平均数
- 左偏形态:平均数<中位数
结论:和中位数相比,平均数总是在“长尾巴”那边。