기댓값의 종류¶
u(X)=X일 때의 기댓값을 기댓값 또는 평균(mean)이라고 한다. 분포함수의 무게 중심을 나타낸다.
u(X)=(X−μ)2일 때의 기댓값을 분산(variance)이라고 한다. 분산의 제곱근을 표준편차(standard deviation, s.d.)라고 한다. 표준편차는 원데이터와 단위를 맞추기 위해 사용한다.
적률생성함수¶
u(X)=etX일 때의 기댓값을 적률생성함수(moment generating function, m.g.f.)라고 한다. 적률생성함수는 cdf와 마찬가지로 분포의 고유한 속성과 연결되기 때문에 적률생성함수가 같은 두 확률변수는 동일한 분포를 따른다.
CDF와 기댓값¶
CDF를 이용하여 기댓값과 분산을 다음과 같이 구할 수 있다.
증명1 : 기댓값¶
기댓값은 확률변수의 지시함수 적분 표현을 이용하여 지시함수의 적분 형태로 표현할 수 있다. (지시함수를 쌓아 올려 원래 값을 복원한다는 의미에서 layer cake representation이라고도 부른다.)
0보다 큰 값을 가지는 확률변수 X>0에 대해,
X=∫0∞1(X>t)dt 이므로,
E[X]=E[∫0∞1(X>t)dt]=∫0∞E[1(X>t)]dtFubini-Tonelli theorem=∫0∞P(X>t)지시함수의 기댓값은 확률이므로dt=∫0∞[1−F(t)]dt 으로 정리할 수 있다.
이를 X∈R인 확률변수로 확장하면,
X=∫0∞1(X>t)dt−∫−∞01(X≤t)dt 이므로,
E[X]=E[∫0∞1(X>t)dt]−E[∫−∞01(X≤t)dt]=∫0∞E[1(X>t)]dt−∫−∞0E[1(X≤t)]dt=∫0∞P(X>t)dt−∫−∞0P(X≤t)dt=∫0∞[1−F(t)]dt−∫−∞0F(t)dt ■
기하학적으로는 기댓값이 X>0에서는 (F(x),1) 구간, X<0에서는 (0,F(x)) 구간을 적분한 값과 동일하다는 의미로 해석할 수 있다.
증명2 : 분산¶
분산은 E(X2)을 구하여 Var(X)=E(X2)−E(X)2에 따라 계산할 수 있다.
X2=∫0∞2t{1(X>t)+1(X≤−t)dt 이므로,
E[X2]=E[∫0∞2t{1(X>t)+1(X≤−t)}dt]=∫0∞2t{E[1(X>t)]+E[1(X≤−t)]}dt=∫0∞2t{P(X>t)+P(X≤−t)}dt=∫0∞2t{1−F(t)+F(−t)}dt 따라서,
Var(X)=∫0∞2t{1−F(t)+F(−t)}dt−E(X)2 ■