概率统计第十一讲:正态分布——多元正态分布的定义、性质、抽样分布与随机变量收敛性¶
1 本讲提要¶
正态分布:
- 多元正态分布的定义(密度函数与特征函数)
- 标准正态分布与线性变换
- 独立性与不相关性
- 等价刻画
- 样本均值与样本方差的抽样分布
随机变量的收敛性:
- 依概率收敛
- 依分布收敛
2 多元正态分布¶
2.1 密度函数定义¶
定义 2.1(多元正态分布)
设 \(\mu \in \mathbb{R}^n\),\(\Sigma\) 为 \(n\) 阶对称正定矩阵,则称 \(n\) 维随机向量 \(X\) 服从 正态分布 \(N(\mu, \Sigma)\),若其联合概率密度函数为
称 \(N(0, I)\) 为 \(n\) 维 标准正态分布,其中 \(I\) 为单位阵。

从标准正态到一般正态:由 \(\Sigma\) 的正定性,存在可逆矩阵 \(A\) 使得 \(\Sigma = AA^\mathsf{T}\)。令 \(Y = A^{-1}(X - \mu)\),则:
即 \(Y \sim N(0, I)\),且 \(X = AY + \mu\)。这建立了标准正态与一般正态之间的线性变换关系。
2.2 标准正态分布的基本性质¶
对 \(X = (X_1, X_2, \dots, X_n)^\mathsf{T} \sim N(0, I)\):
- 各分量 \(X_i \sim N(0, 1)\),\(i = 1, \dots, n\)
- 密度函数可分解:\(p_X(x) = p_{X_1}(x_1) p_{X_2}(x_2) \cdots p_{X_n}(x_n)\),因此 \(X_1, \dots, X_n\) 相互独立
- \(EX = 0\),\(\operatorname{Cov}(X) = (\operatorname{Cov}(X_i, X_j))_{n \times n} = I\)
对 \(X = AY + \mu \sim N(\mu, \Sigma)\)(其中 \(Y \sim N(0, I)\)):
- \(EX = E(AY + \mu) = \mu\)
- \(\operatorname{Cov}(X) = \operatorname{Cov}(AY) = A \operatorname{Cov}(Y) A^\mathsf{T} = AA^\mathsf{T} = \Sigma\)
2.3 协方差矩阵的验证¶
验证 \(\operatorname{Cov}(X) = \Sigma\)
设 \(X \sim N(\mu, \Sigma)\),\(Y = A^{-1}(X - \mu) \sim N(0, I)\)。对 \(Y\) 的各分量,协方差 \(\operatorname{Cov}(Y_i, Y_j) = \delta_{ij}\)。
故 \(\operatorname{Cov}(X) = (\,\sum_{k=1}^n a_{ik} a_{jk})_{n \times n} = AA^\mathsf{T} = \Sigma\)。
2.4 独立性与不相关性等价¶
定理 2.2(正态分布下独立 ⇔ 不相关)
设 \(X = (X_1, \dots, X_n)^\mathsf{T} \sim N(\mu, \Sigma)\),则 \(X_1, \dots, X_n\) 相互独立 当且仅当 \(\operatorname{Cov}(X_i, X_j) = 0\)(\(i \neq j\)),即 \(\Sigma\) 为对角阵。
证明
必要性:显然(独立 ⇒ 协方差为零)。
充分性:设 \(\Sigma = \operatorname{diag}(\sigma_1^2, \dots, \sigma_n^2)\),则 \(\Sigma^{-1} = \operatorname{diag}(1/\sigma_1^2, \dots, 1/\sigma_n^2)\)。此时
联合密度等于各边缘密度的乘积,故分量相互独立。 \(\square\)
直觉
对于一般的联合分布,「独立 ⇒ 不相关」成立,但「不相关 ⇒ 独立」不成立。正态分布是少数几个使得两者等价的分布族之一,这是正态分布最重要的性质之一。
2.5 特征函数¶
定理 2.3(多元正态分布的特征函数)
设 \(X \sim N(\mu, \Sigma)\),其中 \(\mu \in \mathbb{R}^n\),\(\Sigma\) 为 \(n\) 阶对称正定实矩阵,则 \(X\) 的特征函数为
证明
存在可逆矩阵 \(A\) 使得 \(\Sigma = AA^\mathsf{T}\)。令 \(Y = A^{-1}(X - \mu) \sim N(0, I)\),则 \(X = AY + \mu\)。
由于 \(Y\) 各分量独立且 \(Y_k \sim N(0, 1)\),\(\phi_{Y_k}(t_k) = e^{-t_k^2/2}\),故
进而
\(\square\)
反过来,给定上述形式的特征函数,也存在对应的正态分布:
定理 2.4(特征函数刻画)
设 \(\mu \in \mathbb{R}^n\),\(\Sigma\) 为 \(n\) 阶对称正定实矩阵,则存在随机向量 \(X \sim N(\mu, \Sigma)\),使得
是 \(X\) 的特征函数。
2.6 基于特征函数的定义¶
定义 2.5(多元正态分布——特征函数定义)
\(n\) 维随机向量 \(X\) 称为服从 正态分布 \(N(\mu, \Sigma)\),若其特征函数为
推论 2.1(线性变换不变性)
若矩阵 \(B\) 满秩且 \(X \sim N(\mu, \Sigma)\),则 \(BX + b \sim N(B\mu + b,\; B\Sigma B^\mathsf{T})\)。
证明
\(\square\)
2.7 正态分布的等价刻画¶
定理 2.6(正态分布的等价刻画)
\(n\) 维随机向量 \(X\) 服从正态分布,当且仅当对任意 \(a \in \mathbb{R}^n \setminus \{0\}\),\(a^\mathsf{T} X\) 是一维正态随机变量。
证明
必要性:由推论 2.1 直接可得。
充分性:设对任意 \(a \in \mathbb{R}^n \setminus \{0\}\),\(a^\mathsf{T} X\) 为一维正态随机变量。记 \(EX = \mu\),\(\operatorname{Cov}(X) = \Sigma\)。则
故 \(\Sigma\) 正定。又
取 \(t = 1\) 得 \(\phi_X(a) = \phi_{a^\mathsf{T} X}(1) = \exp\{i a^\mathsf{T} \mu - \frac{1}{2} a^\mathsf{T} \Sigma a\}\),由 \(a\) 的任意性及特征函数定义,\(X \sim N(\mu, \Sigma)\)。 \(\square\)

直觉
这个等价刻画意味着:要判断一个随机向量是否是多元正态,只需检验其任意线性投影是否为一元正态。这为多元正态的判定提供了极大便利。
3 正态总体的抽样分布¶
3.1 标准正态总体:\(X_i \overset{\text{iid}}{\sim} N(0, 1)\)¶
定理 3.1(样本均值与样本方差——标准情形)
设 \(X = (X_1, \dots, X_n)^\mathsf{T} \sim N(0, I)\),记样本均值 \(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\)、样本方差 \(S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2\)。则:
- \(\bar{X} \sim N(0,\, 1/n)\);
- \(\bar{X}\) 与 \(S^2\) 相互独立;
- \((n-1)S^2 \sim \chi^2(n-1)\)。

证明(正交变换方法)
构造正交矩阵 \(A\),使其第一行为 \((\frac{1}{\sqrt{n}}, \dots, \frac{1}{\sqrt{n}})\)。令 \(Y = AX\),则 \(Y\) 也服从 \(n\) 维标准正态分布,且 \(EY = 0\),\(\operatorname{Cov}(Y) = AA^\mathsf{T} = I\)。
关键恒等式:
且 \(\bar{X} = Y_1 / \sqrt{n}\) 与 \(S^2 = (Y_2^2 + \cdots + Y_n^2)/(n-1)\) 相互独立。 \(\square\)
3.2 一般正态总体:\(X_i \overset{\text{iid}}{\sim} N(\mu, \sigma^2)\)¶
定理 3.2(样本均值与样本方差——一般情形)
设 \(X = (X_1, \dots, X_n)^\mathsf{T} \sim N(\mu e, \sigma^2 I)\),其中 \(e\) 为全 1 向量。记 \(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\),\(S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2\)。则:
- \(\bar{X}\) 与 \(S^2\) 相互独立;
- \(\bar{X} \sim N(\mu,\, \sigma^2/n)\);
- \(\displaystyle \frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)\);
- \(\displaystyle \frac{\sqrt{n}(\bar{X} - \mu)}{S} \sim t(n-1)\)。
证明
标准化:令 \(Y = (X - \mu e)/\sigma\),则 \(Y \sim N(0, I)\),归结为定理 3.1。
(2) \(\bar{X} = e^\mathsf{T} X / n = e^\mathsf{T}(\sigma Y + \mu e)/n = \sigma e^\mathsf{T} Y / n + \mu = \sigma \bar{Y} + \mu \sim N(\mu, \sigma^2/n)\)(因为 \(\bar{Y} \sim N(0, 1/n)\))。
(3)
(4)
\(\square\)
3.3 两个正态总体的比较¶
推论 3.1(两个独立正态总体的抽样分布)
设 \(X = (X_1, \dots, X_m)^\mathsf{T} \sim N(\mu_1 e, \sigma_1^2 I)\) 与 \(Y = (Y_1, \dots, Y_n)^\mathsf{T} \sim N(\mu_2 e, \sigma_2^2 I)\) 相互独立。记 \(\bar{X}, \bar{Y}\) 为样本均值,\(S_X^2, S_Y^2\) 为样本方差。则:
- \(\displaystyle \frac{S_X^2 / \sigma_1^2}{S_Y^2 / \sigma_2^2} \sim F(m-1,\, n-1)\);
- 当 \(\sigma_1 = \sigma_2 = \sigma\) 时,
证明(第 2 条)
当 \(\sigma_1 = \sigma_2 = \sigma\) 时:
故 \(\frac{(\bar{X} - \bar{Y}) - (\mu_1 - \mu_2)}{\sigma\sqrt{1/m + 1/n}} \sim N(0, 1)\)。又由定理 3.2,\(\frac{(m-1)S_X^2}{\sigma^2} \sim \chi^2(m-1)\),\(\frac{(n-1)S_Y^2}{\sigma^2} \sim \chi^2(n-1)\),且两个卡方变量独立,可加得 \(\frac{(m-1)S_X^2 + (n-1)S_Y^2}{\sigma^2} \sim \chi^2(m+n-2)\)。按 \(t\) 分布定义即得。 \(\square\)
4 随机变量的收敛性¶
4.1 依概率收敛¶
定义 4.1(依概率收敛,Convergence in Probability)
设 \(\{X_n\}\) 为一随机变量序列,\(X\) 为一随机变量。若对任意 \(\varepsilon > 0\),有
则称 \(\{X_n\}\) 依概率收敛 于 \(X\),记为 \(X_n \xrightarrow{P} X\)。

定理 4.1(依概率收敛的四则运算)
设 \(\{X_n\}\)、\(\{Y_n\}\) 为两个随机变量序列,\(a\)、\(b\) 为常数。若 \(X_n \xrightarrow{P} a\),\(Y_n \xrightarrow{P} b\),则:
- \(X_n \pm Y_n \xrightarrow{P} a \pm b\);
- \(X_n Y_n \xrightarrow{P} ab\);
- \(X_n / Y_n \xrightarrow{P} a / b\)(\(b \neq 0\))。
证明(第 1 条:加法)
利用事件包含关系:
故
减法类似。 \(\square\)
证明(第 2 条:乘法)
先证若 \(X_n \xrightarrow{P} 0\) 则 \(X_n^2 \xrightarrow{P} 0\): \(P(|X_n^2| \geq \varepsilon) = P(|X_n| \geq \sqrt{\varepsilon}) \to 0\)。
再证若 \(X_n \xrightarrow{P} a\) 则 \(cX_n \xrightarrow{P} ca\)(\(c \neq 0\) 时)。
最后证 \(X_n \xrightarrow{P} a \Rightarrow X_n^2 \xrightarrow{P} a^2\):
同理 \(Y_n^2 \xrightarrow{P} b^2\),\((X_n + Y_n)^2 \xrightarrow{P} (a+b)^2\)。于是
\(\square\)
证明(第 3 条:除法)
先证 \(1/Y_n \xrightarrow{P} 1/b\)。考虑
再由乘法得 \(X_n / Y_n = X_n \cdot 1/Y_n \xrightarrow{P} a/b\)。 \(\square\)
4.2 依分布收敛¶
定义 4.2(依分布收敛,Convergence in Distribution)
设随机变量 \(X, X_1, X_2, \dots\) 的分布函数分别为 \(F(x), F_1(x), F_2(x), \dots\)。若对 \(F(x)\) 的任意连续点 \(x\),均有
则称 \(\{F_n(x)\}\) 依分布收敛 于 \(F(x)\),记为 \(F_n(x) \xrightarrow{W} F(x)\);也称 \(\{X_n\}\) 依分布收敛于 \(X\),记为 \(X_n \xrightarrow{L} X\)。
定理 4.2(依概率收敛 ⇒ 依分布收敛)
特别地,若 \(X = c\) 为常数,则 \(X_n \xrightarrow{P} c \iff X_n \xrightarrow{L} c\)。
注意:依分布收敛 \(\nRightarrow\) 依概率收敛
反例:设 \(X\) 服从 \(P(X = 1) = P(X = -1) = 1/2\),令 \(X_n = -X\)。则 \(X_n\) 与 \(X\) 同分布,\(X_n \xrightarrow{L} X\)。但对 \(0 < \varepsilon < 2\),
故 \(X_n\) 不依概率收敛于 \(X\)。

直觉
- 依概率收敛:\(X_n\) 和 \(X\) 以高概率取到彼此接近的值(逐点逼近)
- 依分布收敛:只要求分布函数逐点收敛,不关心 \(X_n\) 和 \(X\) 之间的联合关系(分布逼近)
- 依概率收敛更强——它不仅要求分布逼近,还要求 \(|X_n - X|\) 本身趋于零