概率论与数理统计 · 知识点全解
> 参考教材:盛骤等《概率论与数理统计》浙大第四版
> 适用对象:大学理工科各专业
目录结构
| 章节 | 名称 | 核心主题 | 难度 |
|---|---|---|---|
| 第1章 | 概率论的基本概念 | 随机事件、古典概型、条件概率 | ⭐⭐ |
| 第2章 | 随机变量及其分布 | 离散/连续分布、分布函数 | ⭐⭐⭐ |
| 第3章 | 多维随机变量及其分布 | 联合分布、边缘分布、独立性 | ⭐⭐⭐ |
| 第4章 | 随机变量的数字特征 | 期望、方差、协方差 | ⭐⭐ |
| 第5章 | 大数定律与中心极限定理 | 极限定理 | ⭐⭐⭐ |
| 第6章 | 样本及抽样分布 | 统计量、三大分布 | ⭐⭐⭐ |
| 第7章 | 参数估计 | 点估计、区间估计 | ⭐⭐⭐ |
| 第8章 | 假设检验 | 显著性检验 | ⭐⭐⭐⭐ |
| 第9章 | 方差分析与回归分析 | 单因素方差、一元回归 | ⭐⭐⭐⭐ |
第1章 概率论的基本概念
1.1 随机试验与样本空间
1.2 事件的关系与运算
1.3 频率与概率
1.4 古典概型
1.5 条件概率与乘法公式
1.6 全概率公式与贝叶斯公式
1.7 独立性
第2章 随机变量及其分布
2.1 随机变量
2.2 离散型随机变量
| 分布 | 概率分布 | E(X) | D(X) |
|---|---|---|---|
| 0-1分布 | P(X=1)=p | p | p(1-p) |
| 二项分布 B(n,p) | C(n,k)pᵏ(1-p)ⁿ⁻ᵏ | np | np(1-p) |
| 泊松分布 P(λ) | λᵏe⁻λ/k! | λ | λ |
| 几何分布 | (1-p)ᵏ⁻¹p | 1/p | (1-p)/p² |
| 超几何分布 | C(M,k)C(N-M,n-k)/C(N,n) | nM/N | — |
2.3 分布函数
2.4 连续型随机变量
| 分布 | 概率密度 | E(X) | D(X) |
|---|---|---|---|
| 均匀分布 U(a,b) | 1/(b−a) | (a+b)/2 | (b−a)²/12 |
| 指数分布 Exp(λ) | λe⁻λᵡ (x>0) | 1/λ | 1/λ² |
| 正态分布 N(μ,σ²) | (1/√(2π)σ)e^−(x−μ)²/2σ² | μ | σ² |
2.5 正态分布重点
2.6 随机变量函数的分布
第3章 多维随机变量及其分布
3.1 二维随机变量
3.2 边缘分布
3.3 条件分布
3.4 独立性
3.5 两个随机变量函数的分布
第4章 随机变量的数字特征
4.1 数学期望
4.2 方差
4.3 协方差与相关系数
4.4 矩与协方差矩阵
第5章 大数定律与中心极限定理
5.1 切比雪夫不等式
5.2 大数定律
5.3 中心极限定理
第6章 样本及抽样分布
6.1 总体与样本
6.2 常用统计量
6.3 三大抽样分布
6.4 正态总体的抽样分布
第7章 参数估计
7.1 点估计
7.2 估计量的评选标准
7.3 区间估计
7.4 正态总体的区间估计
| 情况 | 枢轴量 | 置信区间 |
|---|---|---|
| σ²已知,估计μ | (_X̅−μ)/(σ/√n) ~ N(0,1) | _X̅ ± z_(α/2)·σ/√n |
| σ²未知,估计μ | (_X̅−μ)/(S/√n) ~ t(n−1) | _X̅ ± t_(α/2)(n−1)·S/√n |
| μ未知,估计σ² | (n−1)S²/σ² ~ χ²(n−1) | [(n−1)S²/χ²_(α/2), (n−1)S²/χ²_(1−α/2)] |
第8章 假设检验
8.1 基本概念
8.2 正态总体均值检验
| 情况 | 检验统计量 | 拒绝域 | ||
|---|---|---|---|---|
| σ²已知,H₀: μ=μ₀ | Z = (_X̅−μ₀)/(σ/√n) | \ | Z\ | > z_(α/2) |
| σ²未知,H₀: μ=μ₀ | t = (_X̅−μ₀)/(S/√n) | \ | t\ | > t_(α/2)(n−1) |
8.3 正态总体方差检验
8.4 两类错误
第9章 方差分析与回归分析
9.1 单因素方差分析
9.2 一元线性回归
🔑 重要公式速查
| 类别 | 公式 | ||
|---|---|---|---|
| 全概率公式 | P(B)=ΣP(Aᵢ)P(B\ | Aᵢ) | |
| 贝叶斯公式 | P(Aᵢ\ | B)=P(Aᵢ)P(B\ | Aᵢ)/P(B) |
| 期望性质 | E(aX+b)=aE(X)+b | ||
| 方差公式 | D(X)=E(X²)−[E(X)]² | ||
| 协方差 | Cov(X,Y)=E(XY)−E(X)E(Y) | ||
| 相关系数 | ρ=Cov(X,Y)/√(D(X)D(Y)) | ||
| 切比雪夫不等式 | P(\ | X−μ\ | ≥ε)≤σ²/ε² |
| 标准化转换 | Z=(X−μ)/σ ~ N(0,1) | ||
| 样本方差 | S²=Σ(Xᵢ−_X̅)²/(n−1) | ||
| 置信区间(μ, σ已知) | _X̅ ± z_(α/2)·σ/√n | ||
| t统计量(μ检验, σ未知) | t=(_X̅−μ₀)/(S/√n) |
📝 配套练习题
第1章 · 概率论的基本概念 练习题
练习1 — 样本空间与事件运算
将一枚均匀硬币抛掷三次,写出该随机试验的样本空间。
样本空间 S = {HHH, HHT, HTH, THH, HTT, THT, TTH, TTT},共 $2^3 = 8$ 个样本点(H表示正面,T表示反面)。
设A、B、C为三个事件,试用A、B、C的运算关系表示下列事件:
(1) A发生,B与C都不发生;
(2) A、B、C中至少有两个发生。
(1) $A \cap \overline{B} \cap \overline{C}$ 或 $A - B - C$
(2) $(A \cap B) \cup (A \cap C) \cup (B \cap C)$(也可写作 $AB \cup AC \cup BC$)
练习2 — 古典概型与条件概率
从1、2、3、4、5这五个数字中任取两个(不放回),求取到的两个数都是奇数的概率。
总取法数:$C_5^2 = 10$
两个奇数(从1,3,5中选):$C_3^2 = 3$
$P = \dfrac{3}{10} = 0.3$
某工厂共有10件产品,其中3件是次品。现从中不放回地任取2件,求:
(1) 两件都是正品的概率;
(2) 已知第一件是正品,第二件也是正品的概率。
(1) $P = \dfrac{C_7^2}{C_{10}^2} = \dfrac{21}{45} = \dfrac{7}{15}$
(2) 设A = "第一件正品",B = "第二件正品"
$P(B|A) = \dfrac{P(AB)}{P(A)} = \dfrac{C_7^2/C_{10}^2}{7/10} = \dfrac{21/45}{7/10} = \dfrac{21}{45} \times \dfrac{10}{7} = \dfrac{2}{3}$
练习3 — 全概率与贝叶斯公式
设甲袋中有2个白球3个黑球,乙袋中有4个白球1个黑球。先从甲袋中任取一球放入乙袋,再从乙袋中任取一球,求从乙袋中取出白球的概率。
设 $A_1$ = "从甲袋取到白球",$A_2$ = "从甲袋取到黑球",B = "从乙袋取到白球"
$P(A_1) = \frac{2}{5},\ P(A_2) = \frac{3}{5}$
$P(B|A_1) = \frac{5}{6},\ P(B|A_2) = \frac{4}{6} = \frac{2}{3}$
由全概率公式:$P(B) = \frac{2}{5} \times \frac{5}{6} + \frac{3}{5} \times \frac{2}{3} = \frac{1}{3} + \frac{2}{5} = \frac{11}{15}$
某种疾病的发病率为0.1%,现有一种检测方法,患者检测为阳性的概率为95%,非患者检测为阳性的概率为2%。若某人检测结果为阳性,求此人真正患病的概率。
设 A = "患病",B = "检测阳性"
$P(A) = 0.001,\ P(\overline{A}) = 0.999$
$P(B|A) = 0.95,\ P(B|\overline{A}) = 0.02$
由贝叶斯公式:
$P(A|B) = \dfrac{P(A)P(B|A)}{P(A)P(B|A) + P(\overline{A})P(B|\overline{A})}$
$= \dfrac{0.001 \times 0.95}{0.001 \times 0.95 + 0.999 \times 0.02}$
$= \dfrac{0.00095}{0.00095 + 0.01998} = \dfrac{0.00095}{0.02093} \approx 0.0454 = 4.54\%$
说明即使检测为阳性,真正患病的概率也只有约4.54%。
练习4 — 事件的独立性
甲、乙两人独立地向同一目标射击,甲的命中率为0.7,乙的命中率为0.6,求:
(1) 目标被击中的概率;
(2) 两人都命中的概率。
设 A = "甲命中"、B = "乙命中",A与B独立
(1) $P(A \cup B) = P(A) + P(B) - P(AB) = 0.7 + 0.6 - 0.7 \times 0.6 = 1.3 - 0.42 = 0.88$
(2) $P(AB) = P(A)P(B) = 0.7 \times 0.6 = 0.42$
一个系统由三个元件独立工作,每个元件的可靠度均为0.9。若系统要求至少两个元件正常工作才能运行,求系统可靠度。
设X为正常工作元件数,则 $X \sim B(3, 0.9)$
$P(X \geq 2) = P(X=2) + P(X=3)$
$= C_3^2 (0.9)^2 (0.1)^1 + C_3^3 (0.9)^3$
$= 3 \times 0.81 \times 0.1 + 0.729$
$= 0.243 + 0.729 = 0.972$
系统可靠度为0.972。
判断:若 $P(A) = 0$,则A是不可能事件。这个说法是否正确?为什么?
不正确。概率为0的事件不一定是不可能事件。
例如在连续型随机变量中,取某一点的概率为0,但该事件是可能发生的。
例如在[0,1]上均匀分布中 $P(X=0.5) = 0$,但X取到0.5是可能发生的。
第2章 · 随机变量及其分布 练习题
练习1 — 离散型随机变量
设随机变量X服从参数为 $n=5,\ p=0.3$ 的二项分布,求:
(1) $P(X=2)$;(2) $P(X\geq 1)$。
(1) $P(X=2) = C_5^2 (0.3)^2 (0.7)^3 = 10 \times 0.09 \times 0.343 = 0.3087$
(2) $P(X \geq 1) = 1 - P(X=0) = 1 - (0.7)^5 = 1 - 0.16807 = 0.83193$
某电话交换台每分钟接到的呼叫次数服从参数 $\lambda = 3$ 的泊松分布,求:
(1) 一分钟内恰好接到2次呼叫的概率;
(2) 一分钟内接到不少于4次呼叫的概率。
$X \sim P(3)$
(1) $P(X=2) = \dfrac{3^2 e^{-3}}{2!} = \dfrac{9e^{-3}}{2} \approx 0.2240$
(2) $P(X \geq 4) = 1 - P(X \leq 3) = 1 - \left(\dfrac{3^0 e^{-3}}{0!} + \dfrac{3^1 e^{-3}}{1!} + \dfrac{3^2 e^{-3}}{2!} + \dfrac{3^3 e^{-3}}{3!}\right)$
$= 1 - e^{-3}(1 + 3 + 4.5 + 4.5) = 1 - 13e^{-3} \approx 1 - 0.6472 = 0.3528$
练习2 — 分布函数
设离散型随机变量X的分布律为:$P(X=0)=0.2,\ P(X=1)=0.3,\ P(X=2)=0.5$,求X的分布函数 $F(x)$,并计算 $P(0.5 < X \leq 2)$。
分布函数:
$F(x) = \begin{cases} 0, & x < 0 \\ 0.2, & 0 \leq x < 1 \\ 0.5, & 1 \leq x < 2 \\ 1, & x \geq 2 \end{cases}$
$P(0.5 < X \leq 2) = F(2) - F(0.5) = 1 - 0.2 = 0.8$
练习3 — 连续型随机变量
设随机变量 $X \sim U(2, 6)$(均匀分布),求:
(1) X的概率密度函数;(2) $P(3 < X < 5)$。
(1) $f(x) = \begin{cases} \frac{1}{4}, & 2 < x < 6 \\ 0, & \text{其他} \end{cases}$
(2) $P(3 < X < 5) = \int_3^5 \frac{1}{4}dx = \frac{1}{4} \times 2 = 0.5$
某电子元件的寿命(单位:小时)服从参数 $\lambda = 0.001$ 的指数分布,求:
(1) 该元件寿命超过1000小时的概率;
(2) 该元件的平均寿命。
$X \sim Exp(0.001)$
(1) $P(X > 1000) = e^{-0.001 \times 1000} = e^{-1} \approx 0.3679$
(2) $E(X) = \frac{1}{\lambda} = 1000$ 小时
练习4 — 正态分布
设 $X \sim N(0,1)$,查表求:
(1) $P(X < 1.5)$;(2) $P(|X| > 1.96)$。
(1) $P(X < 1.5) = \Phi(1.5) = 0.9332$
(2) $P(|X| > 1.96) = 1 - P(|X| \leq 1.96) = 1 - [\Phi(1.96) - \Phi(-1.96)]$
$= 1 - (0.975 - 0.025) = 1 - 0.95 = 0.05$
某次考试的成绩 $X \sim N(72, 8^2)$,求:
(1) 成绩在64到80分之间的概率;
(2) 若规定成绩在X的3σ范围之外的为异常成绩,求异常成绩的概率。
(1) $P(64 < X < 80) = P\left(\frac{64-72}{8} < Z < \frac{80-72}{8}\right) = P(-1 < Z < 1)$
$= \Phi(1) - \Phi(-1) = 0.8413 - 0.1587 = 0.6826$
(2) 3σ原则:$P(|X-\mu| > 3\sigma) = 1 - 0.9973 = 0.0027$,即约0.27%
练习5 — 随机变量函数的分布
设 $X \sim U(0,1)$,求 $Y = X^2$ 的概率密度函数 $f_Y(y)$。
X的密度:$f_X(x) = \begin{cases} 1, & 0 < x < 1 \\ 0, & \text{其他} \end{cases}$
$Y = X^2$,则 $x = \sqrt{y}$,$y \in (0,1)$
分布函数法:$F_Y(y) = P(Y \leq y) = P(X^2 \leq y) = P(X \leq \sqrt{y}) = \sqrt{y}$
求导得:$f_Y(y) = \frac{d}{dy}\sqrt{y} = \frac{1}{2\sqrt{y}},\ 0 < y < 1$
即 $f_Y(y) = \begin{cases} \frac{1}{2\sqrt{y}}, & 0 < y < 1 \\ 0, & \text{其他} \end{cases}$
设 $X \sim N(0,1)$,求 $Y = 3X + 2$ 的分布。
由正态分布的线性性质:$Y = 3X + 2 \sim N(3\mu+2, 9\sigma^2) = N(2, 9)$
即Y服从均值为2、方差为9的正态分布。
设随机变量X的分布律为:$P(X=-2)=0.2,\ P(X=0)=0.3,\ P(X=2)=0.5$,求 $Y = X^2$ 的分布律。
当X = -2或2时,Y = 4;当X = 0时,Y = 0
$P(Y=0) = P(X=0) = 0.3$
$P(Y=4) = P(X=-2) + P(X=2) = 0.2 + 0.5 = 0.7$
Y的分布律:$P(Y=0)=0.3,\ P(Y=4)=0.7$
第3章 · 多维随机变量及其分布 练习题
练习1 — 联合与边缘分布
设二维随机变量 $(X,Y)$ 的联合分布律如下:
| X\Y | 0 | 1 |
|:---:|:-:|:-:|
| 0 | 0.2 | 0.3 |
| 1 | 0.1 | 0.4 |
求X和Y的边缘分布律。
X的边缘分布:
$P(X=0) = 0.2 + 0.3 = 0.5$
$P(X=1) = 0.1 + 0.4 = 0.5$
Y的边缘分布:
$P(Y=0) = 0.2 + 0.1 = 0.3$
$P(Y=1) = 0.3 + 0.4 = 0.7$
设二维随机变量 $(X,Y)$ 的联合概率密度为:
$f(x,y) = \begin{cases} 2e^{-x-2y}, & x>0, y>0 \\ 0, & \text{其他} \end{cases}$
求X和Y的边缘密度函数。
$f_X(x) = \int_{-\infty}^{+\infty} f(x,y)dy = \int_0^{\infty} 2e^{-x-2y}dy = 2e^{-x} \int_0^{\infty} e^{-2y}dy = 2e^{-x} \times \frac{1}{2} = e^{-x},\ x>0$
$f_Y(y) = \int_0^{\infty} 2e^{-x-2y}dx = 2e^{-2y} \int_0^{\infty} e^{-x}dx = 2e^{-2y},\ y>0$
即 $X \sim Exp(1), Y \sim Exp(2)$
练习2 — 条件分布
接上题,求给定 $X=1$ 时Y的条件密度函数 $f_{Y|X}(y|1)$。
$f_{Y|X}(y|1) = \dfrac{f(1,y)}{f_X(1)} = \dfrac{2e^{-1-2y}}{e^{-1}} = 2e^{-2y},\ y>0$
即在 $X=1$ 条件下,Y的条件密度为 $f_{Y|X}(y|1) = \begin{cases} 2e^{-2y}, & y>0 \\ 0, & \text{其他} \end{cases}$
练习3 — 独立性
判断第1题中X与Y是否独立,并说明理由。
检验:$P(X=0)P(Y=0) = 0.5 \times 0.3 = 0.15$,而 $P(X=0,Y=0) = 0.2$
因为 $0.15 \neq 0.2$,所以X与Y不独立。
设 $(X,Y)$ 的联合密度为:
$f(x,y) = \begin{cases} 6xy^2, & 0 判断X与Y是否独立。
$f_X(x) = \int_0^1 6xy^2 dy = 6x \cdot \frac{1}{3} = 2x,\ 0
$f_Y(y) = \int_0^1 6xy^2 dx = 6y^2 \cdot \frac{1}{2} = 3y^2,\ 0
$f_X(x) \cdot f_Y(y) = 2x \cdot 3y^2 = 6xy^2 = f(x,y)$
因此X与Y独立。
练习4 — 随机变量函数的分布
设X和Y独立同分布于 $N(0,1)$,求 $Z = X + Y$ 的分布。
独立正态变量的和仍服从正态分布:
$E(Z) = E(X) + E(Y) = 0 + 0 = 0$
$D(Z) = D(X) + D(Y) = 1 + 1 = 2$
所以 $Z \sim N(0, 2)$。
设X与Y独立,分别服从参数 $\lambda = 2$ 和 $\lambda = 3$ 的指数分布,求 $Z = \min(X,Y)$ 的分布。
$P(Z > z) = P(\min(X,Y) > z) = P(X > z)P(Y > z) = e^{-2z} \cdot e^{-3z} = e^{-5z}$
$F_Z(z) = 1 - P(Z > z) = 1 - e^{-5z},\ z > 0$
所以Z服从参数 $\lambda = 5$ 的指数分布,即 $Z \sim Exp(5)$。
结论:独立指数变量的最小值仍服从指数分布,参数为各参数之和。
设X与Y独立,X服从二项分布 $B(3,0.4)$,Y服从二项分布 $B(2,0.4)$,求 $Z = X+Y$ 的分布。
独立同参数二项分布的和仍服从二项分布:
$Z = X+Y \sim B(3+2, 0.4) = B(5, 0.4)$
即 $P(Z=k) = C_5^k (0.4)^k (0.6)^{5-k},\ k=0,1,\ldots,5$
设X与Y独立,均在 $(0,1)$ 上服从均匀分布,用卷积公式求 $Z=X+Y$ 的概率密度函数。
$f_X(x) = \begin{cases} 1, & 0
卷积公式:$f_Z(z) = \int_{-\infty}^{\infty} f_X(x)f_Y(z-x)dx$
当 $0 < z < 1$ 时:$f_Z(z) = \int_0^z 1 \cdot 1 dx = z$
当 $1 \leq z < 2$ 时:$f_Z(z) = \int_{z-1}^1 1 \cdot 1 dx = 2 - z$
其他情况为0。
即 $f_Z(z) = \begin{cases} z, & 0
这是三角形分布(辛普森分布)。
第4章 · 随机变量的数字特征 练习题
练习1 — 数学期望
设X的分布律为:$P(X=-1)=0.2,\ P(X=0)=0.3,\ P(X=2)=0.5$,求 $E(X)$ 和 $E(2X+3)$。
$E(X) = (-1) \times 0.2 + 0 \times 0.3 + 2 \times 0.5 = -0.2 + 0 + 1 = 0.8$
$E(2X+3) = 2E(X) + 3 = 2 \times 0.8 + 3 = 4.6$
设 $X \sim U(1, 4)$,求 $E(X)$。
均匀分布的期望:$E(X) = \dfrac{a+b}{2} = \dfrac{1+4}{2} = 2.5$
设连续型随机变量X的概率密度为 $f(x) = \begin{cases} 3x^2, & 0 < x < 1 \\ 0, & \text{其他} \end{cases}$,求 $E(X)$ 和 $E(X^2)$。
$E(X) = \int_0^1 x \cdot 3x^2 dx = 3\int_0^1 x^3 dx = 3 \times \frac{1}{4} = \frac{3}{4}$
$E(X^2) = \int_0^1 x^2 \cdot 3x^2 dx = 3\int_0^1 x^4 dx = 3 \times \frac{1}{5} = \frac{3}{5} = 0.6$
练习2 — 方差
接上题第3题,求 $D(X)$。
$D(X) = E(X^2) - [E(X)]^2 = \frac{3}{5} - \left(\frac{3}{4}\right)^2 = \frac{3}{5} - \frac{9}{16} = \frac{48-45}{80} = \frac{3}{80} = 0.0375$
设 $X \sim B(10, 0.4)$,求 $E(X)$ 和 $D(X)$。
二项分布的期望和方差:
$E(X) = np = 10 \times 0.4 = 4$
$D(X) = np(1-p) = 10 \times 0.4 \times 0.6 = 2.4$
已知 $D(X) = 4$,求 $D(3X - 2)$。
$D(aX+b) = a^2 D(X)$
$D(3X-2) = 3^2 \times D(X) = 9 \times 4 = 36$
注意常数项不影响方差。
练习3 — 协方差与相关系数
已知 $E(X)=2,\ E(Y)=3,\ E(XY)=7,\ D(X)=4,\ D(Y)=9$,求协方差 $Cov(X,Y)$ 和相关系数 $\rho_{XY}$。
$Cov(X,Y) = E(XY) - E(X)E(Y) = 7 - 2 \times 3 = 7 - 6 = 1$
$\rho_{XY} = \dfrac{Cov(X,Y)}{\sqrt{D(X)D(Y)}} = \dfrac{1}{\sqrt{4 \times 9}} = \dfrac{1}{6} \approx 0.1667$
判断:"若X与Y不相关,则X与Y独立"是否正确?请举例说明。
不正确。不相关不能推出独立。
反例:设 $X \sim N(0,1)$,令 $Y = X^2$,则:
$E(X) = 0,\ E(XY) = E(X^3) = 0$(奇函数),所以 $Cov(X,Y) = 0 - 0 \times E(Y) = 0$
但Y显然完全由X决定,X与Y不独立。
结论:独立 $\Rightarrow$ 不相关,但不相关 $\nRightarrow$ 独立。
设X和Y相互独立,$D(X)=2,\ D(Y)=3$,求 $D(2X - 3Y + 1)$。
独立时:$D(aX \pm bY + c) = a^2 D(X) + b^2 D(Y)$
$D(2X - 3Y + 1) = 2^2 \times D(X) + (-3)^2 \times D(Y) = 4 \times 2 + 9 \times 3 = 8 + 27 = 35$
第5章 · 大数定律与中心极限定理 练习题
练习1 — 切比雪夫不等式
设 $E(X)=10,\ D(X)=4$,用切比雪夫不等式估计 $P(|X-10| \geq 3)$ 的上界。
切比雪夫不等式:$P(|X-\mu| \geq \varepsilon) \leq \dfrac{\sigma^2}{\varepsilon^2}$
$P(|X-10| \geq 3) \leq \dfrac{4}{3^2} = \dfrac{4}{9} \approx 0.444$
设 $X \sim U(0,4)$,分别用切比雪夫不等式和精确计算求 $P(|X-2| \geq 1)$,并比较结果。
均匀分布 $U(0,4)$:$E(X)=2,\ D(X)=\frac{(4-0)^2}{12} = \frac{4}{3}$
切比雪夫:$P(|X-2| \geq 1) \leq \frac{4/3}{1^2} = \frac{4}{3} \approx 1.333$(上界>1,说明上界无意义)
精确:$P(|X-2| \geq 1) = P(X \leq 1) + P(X \geq 3) = \frac{1}{4} + \frac{1}{4} = 0.5$
切比雪夫给出的不等式虽然是上界,但有时过于宽松(甚至 >1)。
练习2 — 大数定律
简述伯努利大数定律和辛钦大数定律的主要结论。
伯努利大数定律:当试验次数n足够大时,事件发生的频率 $f_n(A)$ 依概率收敛于其概率 $P(A)$。
辛钦大数定律:设 $X_1, X_2, \ldots$ 为独立同分布的随机变量,具有有限的数学期望 $\mu$,则样本均值 $\overline{X}_n$ 依概率收敛于总体均值 $\mu$。
练习3 — 中心极限定理
某校有1000名学生,每人独立地以概率0.8选修某门课。用中心极限定理估计选修人数介于780到820之间的概率。
设X为选修人数,$X \sim B(1000, 0.8)$
$E(X) = 1000 \times 0.8 = 800,\ D(X) = 1000 \times 0.8 \times 0.2 = 160$
由棣莫弗-拉普拉斯CLT:$\dfrac{X-800}{\sqrt{160}} \approx N(0,1)$
$P(780 \leq X \leq 820) = P\left(\frac{780-800}{\sqrt{160}} \leq Z \leq \frac{820-800}{\sqrt{160}}\right)$
$= P(-1.58 \leq Z \leq 1.58) = 2\Phi(1.58) - 1 = 2 \times 0.9429 - 1 = 0.8858$
某食品厂包装每袋薯片重量(克)服从均值为100、标准差为4的分布。随机抽取一箱(50袋),求总重量超过5050克的概率。
设 $X_i$ 为第i袋重量,$E(X_i)=100,\ D(X_i)=16$
总重量 $T = \sum_{i=1}^{50} X_i$,由CLT:$T \approx N(50 \times 100, 50 \times 16) = N(5000, 800)$
$P(T > 5050) = P\left(Z > \frac{5050-5000}{\sqrt{800}}\right) = P\left(Z > \frac{50}{28.28}\right) = P(Z > 1.768)$
$= 1 - \Phi(1.768) \approx 1 - 0.9616 = 0.0384$
某保险公司有10000个客户投保某种保险,每人每年缴保费100元。若出险,保险公司需赔付5000元。设每人出险概率为0.02,且相互独立。用中心极限定理估计保险公司亏损的概率。
设X为出险人数,$X \sim B(10000, 0.02)$
$E(X) = 200,\ D(X) = 10000 \times 0.02 \times 0.98 = 196$
保险公司收入 = $10000 \times 100 = 1,000,000$ 元
亏损条件:$5000X > 1,000,000$,即 $X > 200$
由CLT:$P(X > 200) = P\left(Z > \frac{200-200}{\sqrt{196}}\right) = P(Z > 0) = 0.5$
即约50%的概率亏损(盈亏平衡点在X=200,恰为期望值)。
事实上 $\overline{X}$ 在期望值两侧各约一半,说明保险公司需要收取更多的保费或设置免赔额来降低风险。
独立同分布随机变量序列 $X_i$ 满足 $E(X_i)=5,\ D(X_i)=9$。问n至少多大时,才能使样本均值 $\overline{X}$ 与总体均值5的偏差小于0.5的概率不低于0.95?
由CLT:$\overline{X} \approx N(5, \frac{9}{n})$
$P(|\overline{X} - 5| < 0.5) = P\left(|Z| < \frac{0.5}{3/\sqrt{n}}\right) = P\left(|Z| < \frac{\sqrt{n}}{6}\right) \geq 0.95$
$\therefore \frac{\sqrt{n}}{6} \geq z_{0.025} = 1.96$
$\sqrt{n} \geq 11.76$
$n \geq 138.3$,所以n至少为139。
一袋中有50个白球和50个黑球,从中有放回地抽取100次,用中心极限定理估计抽到白球次数在40到60之间的概率。
设X为抽到白球次数,$X \sim B(100, 0.5)$
$E(X) = 50,\ D(X) = 100 \times 0.5 \times 0.5 = 25$
$P(40 \leq X \leq 60) = P\left(\frac{40-50}{5} \leq Z \leq \frac{60-50}{5}\right)$
$= P(-2 \leq Z \leq 2) = 2\Phi(2) - 1 = 2 \times 0.9772 - 1 = 0.9544$
写出林德伯格-列维中心极限定理的数学表述。
设 $X_1, X_2, \ldots, X_n$ 为独立同分布随机变量,$E(X_i)=\mu,\ D(X_i)=\sigma^2 < \infty$,则:
$\dfrac{\sum_{i=1}^n X_i - n\mu}{\sqrt{n}\sigma} \xrightarrow{d} N(0,1)$
等价地:$\overline{X} \xrightarrow{d} N\left(\mu, \frac{\sigma^2}{n}\right)$
即无论总体分布如何,当n足够大时($n \geq 30$),样本均值近似服从正态分布。
第6章 · 样本及抽样分布 练习题
练习1 — 统计量
从某总体中抽取样本 $X_1, X_2, \ldots, X_n$,判断下列量是否为统计量:
(1) $T_1 = \sum_{i=1}^n X_i$
(2) $T_2 = \frac{1}{n}\sum_{i=1}^n (X_i - \mu)$,其中$\mu$为总体均值
(1) $T_1$ 是统计量——只含样本观测值,不含未知参数。
(2) $T_2$ 不是统计量——包含未知参数$\mu$,除非$\mu$已知。
给定样本数据:2, 4, 6, 8, 10,计算样本均值 $\overline{X}$ 和样本方差 $S^2$。
$\overline{X} = \frac{2+4+6+8+10}{5} = \frac{30}{5} = 6$
$S^2 = \frac{1}{5-1}[(2-6)^2 + (4-6)^2 + (6-6)^2 + (8-6)^2 + (10-6)^2]$
$= \frac{1}{4}[16 + 4 + 0 + 4 + 16] = \frac{40}{4} = 10$
练习2 — 三大抽样分布
设 $Z_1, Z_2, \ldots, Z_6$ 独立同分布于 $N(0,1)$,令 $\chi^2 = Z_1^2 + Z_2^2 + Z_3^2 + Z_4^2 + Z_5^2 + Z_6^2$,求 $E(\chi^2)$ 和 $D(\chi^2)$。
$\chi^2 \sim \chi^2(6)$,卡方分布的期望和方差:
$E(\chi^2) = n = 6$
$D(\chi^2) = 2n = 12$
设 $X \sim N(0,1)$ 与 $Y \sim \chi^2(10)$ 相互独立,求 $T = \dfrac{X}{\sqrt{Y/10}}$ 服从什么分布?
由t分布的定义:$T = \dfrac{Z}{\sqrt{\chi^2/n}}$ 服从自由度为n的t分布。
这里 $Z = X \sim N(0,1)$,$\chi^2 = Y \sim \chi^2(10)$,$n=10$
所以 $T \sim t(10)$,即自由度为10的t分布。
设 $X \sim \chi^2(8)$,$Y \sim \chi^2(12)$ 相互独立,求 $F = \dfrac{X/8}{Y/12}$ 的分布。
由F分布的定义:$F = \dfrac{\chi_1^2/n_1}{\chi_2^2/n_2} \sim F(n_1, n_2)$
这里 $\chi_1^2 = X \sim \chi^2(8)$,$n_1=8$;$\chi_2^2 = Y \sim \chi^2(12)$,$n_2=12$
所以 $F \sim F(8, 12)$,即自由度为(8, 12)的F分布。
练习3 — 正态总体的抽样分布
设总体 $X \sim N(80, 10^2)$,从中抽取容量为25的简单随机样本,求样本均值 $\overline{X}$ 的分布。
正态总体中样本均值的分布:$\overline{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$
$\overline{X} \sim N\left(80, \frac{10^2}{25}\right) = N(80, 4)$
即 $\overline{X}$ 服从均值为80、方差为4的正态分布。
设总体 $X \sim N(\mu, \sigma^2)$,$X_1, \ldots, X_n$ 为样本。证明:$\dfrac{\overline{X} - \mu}{\sigma/\sqrt{n}} \sim N(0,1)$。并指出如果 $\sigma$ 未知,如何构造t统计量。
由 $\overline{X} \sim N(\mu, \frac{\sigma^2}{n})$,标准化得:
$Z = \dfrac{\overline{X} - \mu}{\sigma/\sqrt{n}} \sim N(0,1)$
若 $\sigma$ 未知,用样本标准差S代替$\sigma$:
$t = \dfrac{\overline{X} - \mu}{S/\sqrt{n}} \sim t(n-1)$
这个t统计量服从自由度为 $n-1$ 的t分布。
设总体 $X \sim N(20, 4)$,样本容量 $n=16$,求 $P(\overline{X} > 21)$。
$\overline{X} \sim N(20, \frac{4}{16}) = N(20, 0.25)$
$P(\overline{X} > 21) = P\left(Z > \frac{21-20}{\sqrt{0.25}}\right) = P(Z > 2) = 1 - \Phi(2) = 1 - 0.9772 = 0.0228$
设 $X_1, \ldots, X_n$ 为来自 $N(\mu, \sigma^2)$ 的样本,证明:$\dfrac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)$(其中 $S^2$ 为样本方差)。
证明思路:
$\sum_{i=1}^n \left(\frac{X_i - \mu}{\sigma}\right)^2 \sim \chi^2(n)$
分解:$\sum_{i=1}^n (X_i - \mu)^2 = \sum_{i=1}^n (X_i - \overline{X})^2 + n(\overline{X} - \mu)^2$
即 $\sum_{i=1}^n \left(\frac{X_i - \mu}{\sigma}\right)^2 = \frac{(n-1)S^2}{\sigma^2} + \left(\frac{\overline{X} - \mu}{\sigma/\sqrt{n}}\right)^2$
左边 $\sim \chi^2(n)$,右边第二项 $\sim \chi^2(1)$,由Cochran定理:
$\dfrac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)$
第7章 · 参数估计 练习题
练习1 — 点估计
设总体 $X \sim U(0, \theta)$,样本为 $X_1, \ldots, X_n$,用矩估计法求 $\theta$ 的估计量。
$E(X) = \frac{\theta}{2}$
令样本均值等于总体均值:$\overline{X} = \frac{\theta}{2}$
解得:$\hat{\theta} = 2\overline{X}$
设总体 $X \sim Exp(\lambda)$(指数分布),密度为 $f(x) = \lambda e^{-\lambda x}, x>0$,样本为 $X_1, \ldots, X_n$,用最大似然估计法求 $\lambda$ 的估计量。
似然函数:$L(\lambda) = \prod_{i=1}^n \lambda e^{-\lambda x_i} = \lambda^n e^{-\lambda \sum x_i}$
对数似然:$\ln L = n\ln\lambda - \lambda \sum_{i=1}^n x_i$
求导并令为0:$\frac{d}{d\lambda}\ln L = \frac{n}{\lambda} - \sum x_i = 0$
解得:$\hat{\lambda} = \dfrac{n}{\sum_{i=1}^n X_i} = \dfrac{1}{\overline{X}}$
练习2 — 估计量的评选标准
判断样本均值 $\overline{X}$ 是否为总体均值 $\mu$ 的无偏估计。
$E(\overline{X}) = E\left(\frac{1}{n}\sum_{i=1}^n X_i\right) = \frac{1}{n}\sum_{i=1}^n E(X_i) = \frac{1}{n} \times n\mu = \mu$
因为 $E(\overline{X}) = \mu$,所以 $\overline{X}$ 是 $\mu$ 的无偏估计。
比较总体方差 $\sigma^2$ 的两个估计量:$\hat{\sigma}_1^2 = \frac{1}{n}\sum(X_i - \overline{X})^2$ 和 $\hat{\sigma}_2^2 = S^2 = \frac{1}{n-1}\sum(X_i - \overline{X})^2$,哪个是无偏的?
$E(\hat{\sigma}_1^2) = \frac{n-1}{n}\sigma^2 \neq \sigma^2$,所以 $\hat{\sigma}_1^2$ 是有偏的(偏小)。
$E(\hat{\sigma}_2^2) = E(S^2) = \sigma^2$,所以样本方差 $S^2$ 是 $\sigma^2$ 的无偏估计。
这也是为什么样本方差的分母是 $n-1$ 而不是 $n$。
练习3 — 区间估计
设总体 $X \sim N(\mu, 4)$,样本容量 $n=16$,样本均值 $\overline{x} = 22$,求 $\mu$ 的95%置信区间。($z_{0.025} = 1.96$)
$\sigma$ 已知,用Z分布:$\overline{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$
置信区间:$22 \pm 1.96 \times \frac{2}{\sqrt{16}} = 22 \pm 1.96 \times 0.5 = 22 \pm 0.98$
即 $[21.02, 22.98]$
设总体 $X \sim N(\mu, \sigma^2)$,$\sigma$ 未知。样本容量 $n=10$,$\overline{x}=50$,$s=4$,求 $\mu$ 的95%置信区间。($t_{0.025}(9) = 2.262$)
$\sigma$ 未知,用t分布:$\overline{X} \pm t_{\alpha/2}(n-1) \cdot \frac{S}{\sqrt{n}}$
置信区间:$50 \pm 2.262 \times \frac{4}{\sqrt{10}} = 50 \pm 2.262 \times 1.265 = 50 \pm 2.86$
即 $[47.14, 52.86]$
设总体 $X \sim N(\mu, \sigma^2)$,从该总体中抽取容量为16的样本,得样本均值 $\overline{x}=30$,样本方差 $s^2=25$,求总体方差 $\sigma^2$ 的90%置信区间。($\chi^2_{0.05}(15)=25.0,\ \chi^2_{0.95}(15)=7.26$)
$\sigma^2$ 的置信区间公式:$\left[\dfrac{(n-1)S^2}{\chi^2_{\alpha/2}(n-1)},\ \dfrac{(n-1)S^2}{\chi^2_{1-\alpha/2}(n-1)}\right]$
$n=16,\ n-1=15,\ S^2=25,\ \alpha=0.1$
置信下限:$\dfrac{15 \times 25}{25.0} = \dfrac{375}{25.0} = 15$
置信上限:$\dfrac{15 \times 25}{7.26} = \dfrac{375}{7.26} \approx 51.65$
即 $\sigma^2$ 的90%置信区间为 $[15, 51.65]$
某工厂生产的零件长度 $X \sim N(\mu, 0.5^2)$,要求置信水平为95%,且估计误差不超过0.2,问至少需要抽取多少件产品?($z_{0.025}=1.96$)
估计误差:$d = z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$
$0.2 = 1.96 \times \frac{0.5}{\sqrt{n}}$
$\sqrt{n} = \frac{1.96 \times 0.5}{0.2} = \frac{0.98}{0.2} = 4.9$
$n = 24.01$,所以至少需要抽取25件产品。
设总体 $X \sim N(\mu_1, \sigma^2)$ 和 $Y \sim N(\mu_2, \sigma^2)$ 相互独立,从X中抽取 $n_1=10$ 的样本得 $\overline{x}=85,\ s_1=6$,从Y中抽取 $n_2=12$ 的样本得 $\overline{y}=78,\ s_2=7$。求 $\mu_1 - \mu_2$ 的95%置信区间(假设方差相等)。
方差相等时,用合并方差:$S_p^2 = \dfrac{(n_1-1)S_1^2 + (n_2-1)S_2^2}{n_1+n_2-2}$
$S_p^2 = \dfrac{9 \times 36 + 11 \times 49}{10+12-2} = \dfrac{324 + 539}{20} = \dfrac{863}{20} = 43.15$
$S_p \approx 6.57$
置信区间:$(\overline{x} - \overline{y}) \pm t_{\alpha/2}(n_1+n_2-2) \cdot S_p\sqrt{\frac{1}{n_1} + \frac{1}{n_2}}$
$= (85-78) \pm 2.086 \times 6.57 \times \sqrt{\frac{1}{10} + \frac{1}{12}}$
$= 7 \pm 2.086 \times 6.57 \times 0.428 = 7 \pm 5.87$
即 $[1.13, 12.87]$
第8章 · 假设检验 练习题
练习1 — 基本概念
解释假设检验中第一类错误和第二类错误的含义,并说明它们之间的关系。
第一类错误($\alpha$):拒绝了真实的原假设("冤枉好人"),即弃真错误。
第二类错误($\beta$):接受了错误的原假设("放走坏人"),即纳伪错误。
关系:在样本容量固定的情况下,$\alpha$ 与 $\beta$ 此消彼长——减小$\alpha$会导致$\beta$增大,反之亦然。同时减小两类错误的唯一方法是增大样本容量。
某药厂声称其新药有效率在90%以上。为验证该声明,抽取100名患者进行试验。写出原假设 $H_0$ 和备择假设 $H_1$,并说明显著性水平 $\alpha=0.05$的含义。
$H_0: p \leq 0.9$(有效率不超过90%)
$H_1: p > 0.9$(有效率超过90%,即药厂声明成立)——单边检验
$\alpha = 0.05$ 的含义:如果原假设 $H_0$ 实际上为真,我们错误地拒绝它的概率不超过5%。即我们有95%的把握做出拒绝 $H_0$ 的结论。
练习2 — 正态总体均值检验
某食品厂声称每袋薯片净重为100克。质检部门随机抽取25袋,测得平均净重为98克,标准差为4克。在显著性水平 $\alpha=0.05$ 下,检验该厂声称是否可信。($t_{0.025}(24) = 2.064$)
$H_0: \mu = 100,\ H_1: \mu \neq 100$(双边检验)
$\sigma$ 未知,用t检验:$t = \dfrac{\overline{x} - \mu_0}{s/\sqrt{n}} = \dfrac{98-100}{4/\sqrt{25}} = \dfrac{-2}{0.8} = -2.5$
临界值:$t_{0.025}(24) = 2.064$,拒绝域为 $|t| > 2.064$
因为 $|t| = 2.5 > 2.064$,落在拒绝域内,所以拒绝 $H_0$。
结论:在显著性水平0.05下,认为该厂声称的净重不可信(显著偏轻)。
某校历年数学平均分为75分(标准差已知为10)。今年改革后,随机抽取36名学生,平均分78分。问改革是否有效提高了成绩?($\alpha=0.05,\ z_{0.05}=1.645$)
$H_0: \mu \leq 75,\ H_1: \mu > 75$(单边检验,看是否提高)
$\sigma$ 已知,用Z检验:$Z = \dfrac{\overline{x} - \mu_0}{\sigma/\sqrt{n}} = \dfrac{78-75}{10/\sqrt{36}} = \dfrac{3}{10/6} = 1.8$
单边临界值:$z_{0.05} = 1.645$,拒绝域为 $Z > 1.645$
因为 $1.8 > 1.645$,拒绝 $H_0$。
结论:在显著性水平0.05下,认为改革显著提高了数学成绩。
练习3 — 正态总体方差检验
某车间生产的零件直径方差标准为 $0.01$(mm²)。现抽取20个零件,测得样本方差 $s^2=0.016$。在 $\alpha=0.05$ 下检验方差是否显著增大。($\chi^2_{0.05}(19)=30.14$)
$H_0: \sigma^2 \leq 0.01,\ H_1: \sigma^2 > 0.01$(单边检验)
$\chi^2 = \dfrac{(n-1)S^2}{\sigma_0^2} = \dfrac{19 \times 0.016}{0.01} = \dfrac{0.304}{0.01} = 30.4$
临界值:$\chi^2_{0.05}(19) = 30.14$,拒绝域为 $\chi^2 > 30.14$
因为 $30.4 > 30.14$,拒绝 $H_0$。
结论:在显著性水平0.05下,认为方差显著增大,生产过程不稳定。
练习4 — 综合应用
某公司声称其产品合格率不低于98%。随机抽查200件,发现6件不合格。在 $\alpha=0.05$ 下检验公司声明是否可信。($z_{0.05}=1.645$)
$H_0: p \geq 0.98,\ H_1: p < 0.98$(单边检验,看是否低于声称)
样本比例:$\hat{p} = \frac{200-6}{200} = 0.97$
检验统计量:$Z = \dfrac{\hat{p} - p_0}{\sqrt{p_0(1-p_0)/n}} = \dfrac{0.97-0.98}{\sqrt{0.98 \times 0.02 / 200}} = \dfrac{-0.01}{\sqrt{0.000098}} = \dfrac{-0.01}{0.0099} \approx -1.01$
临界值:$-z_{0.05} = -1.645$,拒绝域为 $Z < -1.645$
因为 $-1.01 > -1.645$,未落在拒绝域内,所以不拒绝 $H_0$。
结论:在显著性水平0.05下,没有充分证据否定公司的声明。
设两个正态总体 $X \sim N(\mu_1, \sigma^2)$ 和 $Y \sim N(\mu_2, \sigma^2)$ 方差相等但未知。从X中抽取12个样品得 $\overline{x}=80$,从Y中抽取15个样品得 $\overline{y}=74$,合并标准差 $S_p=6$。检验 $\mu_1$ 与 $\mu_2$ 是否有显著差异。($\alpha=0.05,\ t_{0.025}(25)=2.06$)
$H_0: \mu_1 = \mu_2,\ H_1: \mu_1 \neq \mu_2$(双边检验)
$t = \dfrac{\overline{x} - \overline{y}}{S_p\sqrt{\frac{1}{n_1} + \frac{1}{n_2}}} = \dfrac{80-74}{6 \times \sqrt{\frac{1}{12} + \frac{1}{15}}} = \dfrac{6}{6 \times \sqrt{0.0833+0.0667}} = \dfrac{6}{6 \times 0.387} = \dfrac{6}{2.322} \approx 2.58$
临界值:$t_{0.025}(25) = 2.06$,拒绝域为 $|t| > 2.06$
因为 $2.58 > 2.06$,拒绝 $H_0$。
结论:在显著性水平0.05下,认为两总体的均值存在显著差异。
某路段限速70km/h。交通部门随机测速记录25辆车,得平均车速 $\overline{x}=73$km/h,标准差 $s=6$km/h。在 $\alpha=0.05$ 下检验该路段车辆是否平均超速。($t_{0.05}(24)=1.711$)
$H_0: \mu \leq 70,\ H_1: \mu > 70$(单边检验)
$t = \dfrac{\overline{x} - \mu_0}{s/\sqrt{n}} = \dfrac{73-70}{6/\sqrt{25}} = \dfrac{3}{1.2} = 2.5$
临界值:$t_{0.05}(24) = 1.711$,拒绝域为 $t > 1.711$
因为 $2.5 > 1.711$,拒绝 $H_0$。
结论:在显著性水平0.05下,认为该路段车辆平均速度显著超过限速70km/h。
什么是P值?如果 $P=0.03$,在 $\alpha=0.05$ 下是否拒绝原假设?
P值:在原假设成立的条件下,出现当前样本结果或更极端结果的概率。
判断准则:$P \leq \alpha$ 时拒绝 $H_0$,否则不拒绝 $H_0$。
因为 $P=0.03 < \alpha=0.05$,所以拒绝原假设。
P值越小,拒绝原假设的理由越充分。P值同时也衡量了结果在统计上的显著性。
第9章 · 方差分析与回归分析 练习题
练习1 — 单因素方差分析
单因素方差分析中,已知总离差平方和 $SST=100$,组内离差平方和 $SSE=60$,组数 $k=3$,总观测数 $n=15$,求组间离差平方和 $SSA$ 以及检验统计量 $F$ 的值。
$SST = SSA + SSE \Rightarrow SSA = SST - SSE = 100 - 60 = 40$
$MSA = \dfrac{SSA}{k-1} = \dfrac{40}{2} = 20$
$MSE = \dfrac{SSE}{n-k} = \dfrac{60}{12} = 5$
$F = \dfrac{MSA}{MSE} = \dfrac{20}{5} = 4$
为比较三种不同肥料对作物产量的影响,每种肥料各施用于4块土地,得产量数据如下(单位:kg):
A: 20, 22, 21, 19
B: 18, 20, 17, 19
C: 25, 24, 26, 23
试完成方差分析表,并判断肥料间是否有显著差异($\alpha=0.05$)。
总均值:$\overline{x} = \frac{20+22+21+19+18+20+17+19+25+24+26+23}{12} = \frac{254}{12} \approx 21.17$
组均值:$\overline{x}_A=20.5,\ \overline{x}_B=18.5,\ \overline{x}_C=24.5$
$SSA = 4[(20.5-21.17)^2 + (18.5-21.17)^2 + (24.5-21.17)^2] = 4[0.45 + 7.13 + 11.09] = 4 \times 18.67 = 74.68$
$SSE = \sum (x_{ij} - \overline{x}_i)^2 = (0.25+2.25+0.25+2.25) + (0.25+2.25+2.25+0.25) + (0.25+0.25+2.25+2.25) = 5 + 5 + 5 = 15$
$F = \frac{74.68/2}{15/9} = \frac{37.34}{1.667} \approx 22.4$
查表 $F_{0.05}(2,9) = 4.26$,因为 $22.4 > 4.26$,所以不同肥料对产量有显著影响。
方差分析中有哪几个基本假定?
三个基本假定:
(1) 正态性:每个总体的观测值来自正态分布
(2) 方差齐性:各总体的方差相等
(3) 独立性:各观测值相互独立
方差分析对正态性假定有一定稳健性,但对方差齐性较为敏感。
练习2 — 一元线性回归
收集了5对数据 $(x,y)$:$(1,2),\ (2,3),\ (3,5),\ (4,6),\ (5,7)$,求回归方程 $\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x$。
$\overline{x}=3,\ \overline{y}=4.6$
$\sum(x_i - \overline{x})(y_i - \overline{y}) = (-2)(-2.6) + (-1)(-1.6) + (0)(0.4) + (1)(1.4) + (2)(2.4) = 5.2 + 1.6 + 0 + 1.4 + 4.8 = 13$
$\sum(x_i - \overline{x})^2 = 4 + 1 + 0 + 1 + 4 = 10$
$\hat{\beta}_1 = \frac{13}{10} = 1.3$
$\hat{\beta}_0 = \overline{y} - \hat{\beta}_1\overline{x} = 4.6 - 1.3 \times 3 = 4.6 - 3.9 = 0.7$
回归方程:$\hat{y} = 0.7 + 1.3x$
接上题,计算决定系数 $R^2$,说明回归方程对数据的拟合程度。
预测值:$\hat{y} = 0.7 + 1.3x$
$x=1: \hat{y}=2.0,\ x=2: \hat{y}=3.3,\ x=3: \hat{y}=4.6,\ x=4: \hat{y}=5.9,\ x=5: \hat{y}=7.2$
$SSR = \sum(\hat{y}_i - \overline{y})^2 = (2-4.6)^2 + (3.3-4.6)^2 + (4.6-4.6)^2 + (5.9-4.6)^2 + (7.2-4.6)^2$
$= 6.76 + 1.69 + 0 + 1.69 + 6.76 = 16.9$
$SST = \sum(y_i - \overline{y})^2 = (2-4.6)^2 + (3-4.6)^2 + (5-4.6)^2 + (6-4.6)^2 + (7-4.6)^2$
$= 6.76 + 2.56 + 0.16 + 1.96 + 5.76 = 17.2$
$R^2 = \dfrac{SSR}{SST} = \dfrac{16.9}{17.2} \approx 0.9826$
$R^2=0.9826$ 说明回归方程解释了约98.26%的y的变异,拟合效果很好。
接第4题,对回归系数 $\beta_1$ 进行显著性检验($H_0: \beta_1 = 0$),已知 $\hat{\sigma}^2 = \frac{SSE}{n-2}$,$t_{0.025}(3) = 3.182$。
$SSE = SST - SSR = 17.2 - 16.9 = 0.3$
$\hat{\sigma}^2 = \frac{SSE}{n-2} = \frac{0.3}{3} = 0.1$
$SE(\hat{\beta}_1) = \sqrt{\frac{\hat{\sigma}^2}{\sum(x_i - \overline{x})^2}} = \sqrt{\frac{0.1}{10}} = \sqrt{0.01} = 0.1$
$t = \frac{\hat{\beta}_1}{SE(\hat{\beta}_1)} = \frac{1.3}{0.1} = 13$
临界值 $t_{0.025}(3) = 3.182$,因为 $13 > 3.182$,拒绝 $H_0$。
结论:回归系数 $\beta_1$ 高度显著,x与y之间存在显著的线性关系。
已知回归方程 $\hat{y} = 2 + 0.8x$,$n=20$,$SST=200$,$R^2=0.64$,求 $SSR$ 和 $SSE$。
$R^2 = \dfrac{SSR}{SST} = 0.64$
$SSR = 0.64 \times 200 = 128$
$SSE = SST - SSR = 200 - 128 = 72$
在回归分析中,残差分析的主要目的是什么?列举两种常见的残差图及其用途。
残差分析目的:检验回归模型的基本假定是否满足,包括线性性、方差齐性、独立性和正态性。
常见残差图:
(1) 残差 vs 拟合值图:若残差随机分布在0附近且无明显模式,说明线性假定和方差齐性成立;若呈喇叭状,说明方差不齐。
(2) 残差的QQ图:用于检验残差是否服从正态分布。若点大致落在对角线上,说明正态性假定成立。
解释 "总体回归模型" 和 "样本回归方程" 的区别。
总体回归模型:$Y = \beta_0 + \beta_1 X + \varepsilon$,$\varepsilon$ 为随机误差项,$\beta_0, \beta_1$ 是未知的总体参数。
样本回归方程:$\hat{Y} = \hat{\beta}_0 + \hat{\beta}_1 X$,是根据样本数据估计得出的回归直线,$\hat{\beta}_0, \hat{\beta}_1$ 是总体参数 $\beta_0, \beta_1$ 的估计值。
区别:总体模型包含随机误差项 $\varepsilon$,反映因变量Y不能由X完全解释的部分;样本回归方程是估计的确定关系,$\hat{Y}$ 是Y的条件均值估计。