跳转至

Moments

Summaries of a Distribution

除了期望和方差之外,中位数(median)和众数(mode)也是定于分布的一种总结,定义如下

如果\(c\)满足\(P(X\le c)\ge 1/2\)\(P(X\ge c)\ge 1/2\),那么\(c\)是随机变量\(X\)中位数

最常见的情况是\(X\)的 CDF 在\(c\)处等于1/2,但是 CDF 可能存在跳跃间断点

对于离散随机变量\(X\),如果\(c\)满足\(P(X=c)\ge P(X=x)\),那么\(c\)\(X\)众数
对于 PDF 为\(f\)的连续随机变量\(X\),如果\(c\)满足\(f(c)\ge f(x)\),那么\(c\)\(X\)众数

随机变量的中位数和众数只取决于分布

不同的总结反应了数据不同的的特征,所以很难选择一个数字来代表整个分布。具体选择哪一个数字取决于目标。

对于一个结果未知的随机变量,如果要猜测一个数\(c\)来预测随机变量的值,中位数和期望都是不错的选择,但那个更好取决于如何定义更好: 均方误差(mean squared error)\(E(X-c)^2\)平均绝对误差(mean absolute error)\(E|X-c|\)是两种方法

定理 假设\(X\)是一个期望为\(\mu\)中位数为\(m\)的随机变量,那么

  • 使均方误差\(E(X-c)^2\)最小的 \(c\)\(\mu\)
  • 使平均绝对误差\(E|X-c|\)最小的\(c\)\(m\)
证明

也就是说,如果选择用均方误差作为判断依据,应该猜测\(c=\mu\);而选择用平均绝对误差作为判断依据,应该猜测 \(c=m\)

Interpreting Moments

如果\(X\)是一个期望为\(\mu\),方差为\(\sigma^2\)的随机变量,那么\(X\)\(n\)(moments)为\(E(X^n)\);\(X\)\(n\)中心矩(central moments)为\(E((X-\mu)^n)\);\(X\)\(n\)标准矩(standard moments)为\(E\left(\left(\dfrac{X-\mu}{\sigma}\right)^n\right)\)

期望是一阶矩,方差是二阶中心矩

如果\(X-\mu\)\(\mu-X\)有相同的分布,那么随机变量\(X\)的分布关于\(\mu\)对称

上面定义中的\(\mu\)就是\(X\)的期望\(E(X)\)(如果存在),因为 $$ E(X)-\mu=E(X-\mu)=E(\mu-X)=\mu-E(X) $$ 化简后得到\(E(X)=\mu\) \(\mu\)同时也是\(X\)的中位数,因为 $$ P(X-\mu\le0)=P(\mu-X\le0) $$ 即\(P(X\le\mu)=P(X\ge\mu)\),因此 $$ P(X\le\mu)=1-P(X>\mu)\ge1-P(X\ge\mu)=1-P(X\le\mu) $$ 所以\(P(X\le\mu)\ge1/2\)\(P(X\ge\mu)\ge1/2\)

如果\(X\)关于\(\mu\)对称,那么\(X-\mu\)关于0对称

命题:对称的 PDF 表示
如果\(X\)是 PDF 为\(f\)的连续随机变量,那么\(X\)关于\(\mu\)对称当且仅当对于所有\(x,f(x)=f(2\mu-x)\)

证明

命题:对称分布的奇数阶中心矩
如果\(X\)关于\(\mu\)对称,那么对于任意奇数\(m\),\(X\)\(m\)阶中心矩\(E((X-\mu)^m)=0\)

证明

如果随机变量\(X\)不是对称的,那么可以用偏度(skewness)来衡量它的不对称程度 期望为\(\mu\),方差为\(\sigma^2\)的随机变量\(X\)的偏度为它的三阶标准矩,即 $$ \text{Skew}(X)=E\left(\frac{X-\mu}{\sigma}\right)^3 $$ 偏度为正表示分布向右偏,偏度为负表示分布向左偏

分布的另一个重要描述特征是它的尾部有多厚,称为峰度(kurtosis),与偏度类似,峰度用四阶标准矩来表示 期望为\(\mu\),方差为\(\sigma^2\)的随机变量\(X\)的峰度为它的四阶标准矩,即 $$ \text{Kurt}(X)=E\left(\frac{X-\mu}{\sigma}\right)^4-3 $$

在最后减3的原因是可以使标准正态分布的峰度为0.有的资料将不减3的情况定义为峰度,而将上面的定义为 excess kurtosis

Sample Moments

假设\(X_1,X_2,\cdots,X_n\)是独立同分布随机变量,那么它们的 \(k\) 阶样本矩(kth sample moment)是随机变量 $$ M_k=\frac{1}{n}\sum_{j=1}^{n} X_j^k $$

样本均值(sample mean) \(\bar{X}_n\) 是一阶样本矩,即 \(\bar{X}_n = \dfrac{1}{n} \sum\limits_{j=1}^{n} X_j\)

定理:样本均值的期望与方差
假设\(X_1,X_2,\cdots,X_n\)是期望为\(\mu\),方差为 \(\sigma^2\) 的独立同分布随机变量,那么样本均值 \(\bar{X}_n\) 的期望为 $$ E(\bar{X}_n)=\mu $$ 方差为 $$ Var(\bar{X}_n)=\frac{\sigma^2}{n} $$

假设\(X_1,X_2,\cdots,X_n\)为独立同分布随机变量,那么它们的样本方差定义(sample variance)为 $$ S_n^2=\frac{1}{n-1}\sum_{j=1}^{n}(X_j-\bar{X}_n)^2 $$
样本标准差(sample standard deviation)是样本方差的平方根

定理:样本方差的无偏性
假设\(X_1,X_2,\cdots,X_n\)是期望为\(\mu\),方差为\(\sigma^2\)的独立同分布随机变量,那么样本方差\(S_n^2\)\(\sigma^2\)的无偏估计,即 $$ E(S_n^2)=\sigma^2 $$

Moment Generating Function

生成函数在组合数学和概率论中是一个非常强大的工具,它连接了数列和微积分。在概率论中,它们对于研究离散和连续分布都很有用。矩母函数(moment generating function, MGF)就是一种生成函数,它用来表示一个分布的矩。

随机变量\(X\)的矩母函数(MGF)为 $$ M(t)=E(e^{tX}) $$ 是一个关于\(t\)的函数。如果它在包含0的开区间\((a,b)\)上是有限的,那么函数存在;否则不存在。

定义中的 \(t\) 并没有特别的含义,它只是一个被引入的变量,以便我们可以使用微积分进行计算,而不是处理一系列离散的情况

定理:通过 MGF的导数求矩
如果已知随机变量\(X\)的 MGF ,那么\(X\)\(n\) 阶矩为 MGF 在0处的 \(n\) 阶导数,即 $$ E(X^n)=M^{(n)}(0) $$

证明

\(M(t)\)在0处的泰勒展开式为 $$ M(t)=\sum_{n=0}^{\infty}M^{(n)}(0)\frac{t^n}{n!} $$ 另一方面,可以得到 $$ M(t)=E(e^{tX})=E\left(\sum_{n=0}^{\infty}X^n\frac{t^n}{n!}\right)=\sum_{n=0}^{\infty}E(X^n)\frac{t^n}{n!} $$ 对比上面两个式子的系数,可以得到 $$ E(X^n)=M^{(n)}(0) $$

定理:MGF 决定分布
随机变量的 MGF 决定了它的分布:如果两个随机变量有相同的 MGF,那么它们的分布一定相同

定理:独立随机变量 MGF 的和
如果随机变量\(X\)\(Y\)是独立的,那么随机变量\(X+Y\)的 MGF 是两个单独 MGF 的乘积,即 $$ M_{X+Y}(t)=M_X(t)\cdot M_Y(t) $$

并不是所有的随机变量都有 MGF

在前面我们通过位置-尺度变换从一个初始分布得到新的分布,MGF 也同样可以使用位置-尺度变换

命题:MGF 的位置-尺度变换
如果随机变量\(X\)的 MGF 为\(M(t)\),那么\(a+bX\)的 MGF 为 $$ E(e^{t(a+bX)})=e^{at}E(e^{btX})=e^{at}M(bt) $$

下面利用上面的定理,证明一些分布的 MGF:

如果\(X\sim\text{Bern}(p)\),那么它的 MGF 为 $$ M(t)=E(e^{tX})=e^{t}p+e^{0}q=pe^t+q $$

如果\(X\sim\text{Bin}(n,p)\),那么可以将它看作一系列独立同分布的伯努利分布,根据独立随机变量 MGF 的和的定理 $$ M(t)=(pe^t+q)^n $$

如果\(X\sim\text{Geom}(p)\),那么它的 MGF 为 $$ M(t)=\sum_{k=0}^{\infty}e^{tk}pq^k=p\sum_{k=0}^{\infty}(e^tq)^k=\frac{p}{1-qe^t} $$

如果\(X\sim\text{NBin}(r,p)\),那么可以将它看作一系列独立同分布的几何分布,根据独立随机变量 MGF 的和的定理 $$ M(t)=\left(\frac{p}{1-qe^t}\right)^r $$

如果\(X\sim\text{Pois}(\lambda)\),那么它的 MGF 为 $$ M(t)=\sum_{k=0}^{\infty}e^{tk}\frac{e^{{-\lambda}}\lambda^k}{k!}=e^{-\lambda}e^{\lambda e^t}=e^{\lambda (e^t-1)} $$

标准正态分布\(Z\)的 MGF 为 $$ M_Z(t)=E(e^{tZ})=\int_{-\infty}^{\infty}e^{tz}\frac{1}{\sqrt{2\pi}}e^{-z^2/2}dz=e^{t^2/2}\int_{-\infty}^{\infty}\frac{1}{\sqrt{2\pi}}e^{-(z-t)^2/2}dz=e^{t^2/2} $$ 令\(X=\mu+\sigma Z\sim\mathcal{N}(\mu, \sigma^2)\),那么 $$ M_X(t)=e^{\mu t}M_Z(\sigma t)=e^{\mu t+\frac12\sigma^2t^2} $$

如果\(X\sim\text{Expo}(1)\),那么它的 MGF 为 $$ M(t)=E(e^{tX})=\int_{0}^{\infty}e^{tx}e^{-x}dx=\int_{0}^{\infty}e^{-x(1-t)}dx=\frac{1}{1-t} $$ 因此,\(Y=X/\lambda\sim\text{Expo}(\lambda)\)的 MGF 为 $$ M_Y(t)=M_X\left(\frac{t}{\lambda}\right)=\frac{\lambda}{\lambda-t} $$

Sum of Independent r.v.s via MGFs

由于独立随机变量之和的 MGF 是各自MGF 的乘积,我们现在有了一种新的策略来找出独立随机变量之和的分布:把各个独立随机变量的 MGF 相乘,然后看看这个乘积是否可以符合某个已知分布的 MGF

独立泊松分布的和

使用 MGF, 可以证明两个独立的泊松分布随机变量的和是一个泊松分布,首先证明泊松分布\(X\sim\text{Pois}(\lambda)\)的 MGF 为 $$ E(e^{tX})=\sum_{k=0}^{\infty}e^{tk}\frac{e^{{-\lambda}}\lambda^k}{k!}=e^{-\lambda}\sum_{k=0}^{\infty}\frac{(\lambda e^t)^k}{k!}=e^{-\lambda}e^{\lambda e^t}=e^{\lambda (e^t-1)} $$ 假设一个与\(X\)独立的泊松分布\(Y\sim\text{Pois}(\mu)\),那么\(X+Y\)的 MGF 为 $$ E(e^{t(X+Y)})=E(e^{tX})\cdot E(e^{tY})=e^{\lambda (e^t-1)}\cdot e^{\mu (e^t-1)}=e^{(\lambda+\mu)(e^t-1)} $$ 因为MGF决定分布,因此\(X+Y\)的分布为泊松分布\(Pois(\lambda+\mu)\)

Cramer 定理
如果两个独立的随机变量\(X_1\)\(X_2\)的和\(X_1+X_2\)是正态分布,那么\(X_1\)\(X_2\)一定也是正态分布

Probability Generating Function

概率生成函数(probability generating function, PGF)类似于 MGF ,对于非负整数值,PGF 一定存在

非负整数值随机变量 \(X\) 的 PGF 是其PMF 的生成函数,设 PMF 为\(p_k = P(X = k)\)。根据 LOTUS,可以表示为 $$ E(t^X)=\sum_{k=0}^{\infty}p_kt^k $$ MGF 与 PGF 密切相关,当 MGF 和 PGF 都存在时 $$ E(t^X)=E(e^{X\log t})=M(\log t),t>0 $$

评论