베타(beta) 분포는 [ 0 , 1 ] [0,1] [ 0 , 1 ] 에서 정의되는 분포로, 베이지안 모델링에서 이항 분포하는 변수의 사전 분포로 자주 사용되고, 정해진 구간 [ a , b ] [a, b] [ a , b ] 에서 변화하는 확률변수를 모델링하는 데에 사용하기도 한다. (프로젝트 네트워크에서 각 작업의 소요시간 분포)
베타 분포는 감마 분포를 따르는 두 확률변수의 비율이 베타 분포를 따르며, 이 성질을 이용하여 확률밀도함수를 유도할 수 있다. 이렇게 구한 밀도함수에서 정규화 상수로 베타 함수를 사용하며, 이 때문에 1940년대까지 피어슨 1유형 분포라고 불리다가 지금은 베타 분포라고 부른다.
항목 내용 기호 X ∼ Beta ( α , β ) X \sim \text{Beta}(\alpha, \beta) X ∼ Beta ( α , β ) 지지 집합 [ 0 , 1 ] [0, 1] [ 0 , 1 ] 형상 모수 α , β > 0 \alpha, \beta > 0 α , β > 0 평균 α α + β \dfrac{\alpha}{\alpha+\beta} α + β α 분산 α β ( α + β ) 2 ( α + β + 1 ) \dfrac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)} ( α + β ) 2 ( α + β + 1 ) α β 활용 비율이나 확률 자체를 모델링, 유한구간의 변수 모델링
확률밀도함수 유도 ¶ 독립적인 두 확률변수 X 1 X_1 X 1 과 X 2 X_2 X 2 가 각각 X 1 ∼ G a m m a ( α , 1 ) X_1 \sim Gamma(\alpha, 1) X 1 ∼ G amma ( α , 1 ) , X 2 ∼ G a m m a ( β , 1 ) X_2 \sim Gamma(\beta, 1) X 2 ∼ G amma ( β , 1 ) 의 분포를 따를 때, Y = X 1 X 1 + X 2 Y = \frac{X_1}{X_1 + X_2} Y = X 1 + X 2 X 1 의 확률밀도함수를 구하는 과정은 다음과 같다.
우선, Z = X 1 + X 2 Z = X_1 + X_2 Z = X 1 + X 2 라는 보조변수를 도입하면, Y Y Y , Z Z Z 의 결합확률밀도함수를 구하는 문제는,
A = { ( x 1 , x 2 ) ∣ 0 ≤ x 1 , x 2 } B = { ( y , z ) ∣ 0 ≤ y ≤ 1 , 0 ≤ z } A = \{ (x_1, x_2) | 0 \leq x_1, x_2 \} \\
\\
B = \{ (y, z) | 0 \leq y \leq 1, 0 \leq z \} A = {( x 1 , x 2 ) ∣0 ≤ x 1 , x 2 } B = {( y , z ) ∣0 ≤ y ≤ 1 , 0 ≤ z } 에서 A A A 에서 B B B 로의 전단사 변환이 된다.
Y = u ( X 1 , X 2 ) = X 1 X 1 + X 2 Y = u(X_1, X_2) = \frac {X_1}{X_1 + X_2} Y = u ( X 1 , X 2 ) = X 1 + X 2 X 1 , Z = v ( X 1 , X 2 ) = X 1 + X 2 Z = v(X_1, X_2) = X_1 + X_2 Z = v ( X 1 , X 2 ) = X 1 + X 2 를 역변환하면 아래와 같다.
u − 1 ( Y , Z ) : X 1 = Y Z v − 1 ( Y , Z ) : X 2 = Z ( 1 − Y ) u^{-1}(Y, Z) : X_1 = YZ \\
\\
v^{-1}(Y, Z) : X_2 = Z(1-Y) u − 1 ( Y , Z ) : X 1 = Y Z v − 1 ( Y , Z ) : X 2 = Z ( 1 − Y ) 자코비안 행렬을 구하면 다음과 같다.
∣ J ∣ = ∣ ∂ x 1 ∂ y ∂ x 1 ∂ z ∂ x 2 ∂ y ∂ x 2 ∂ z ∣ = ∣ z y − z 1 − y ∣ = z |J| = \begin{vmatrix} \frac{\partial x_1}{\partial y} & \frac{\partial x_1}{\partial z} \\ \frac{\partial x_2}{\partial y} & \frac{\partial x_2}{\partial z} \end{vmatrix}
= \begin{vmatrix} z & y \\ -z & 1-y \end{vmatrix} = z ∣ J ∣ = ∣ ∣ ∂ y ∂ x 1 ∂ y ∂ x 2 ∂ z ∂ x 1 ∂ z ∂ x 2 ∣ ∣ = ∣ ∣ z − z y 1 − y ∣ ∣ = z 위를 바탕으로, ( Y , Z ) (Y, Z) ( Y , Z ) 의 결합확률밀도함수를 구하면,
f Y , Z ( y , z ) = f X 1 ( y z ) f X 2 ( z ( 1 − y ) ) = 1 Γ ( α ) ( y z ) α − 1 e − y z 1 Γ ( β ) { z ( 1 − y ) } β − 1 e − z ( 1 − y ) = 1 Γ ( α ) Γ ( β ) y α − 1 ( 1 − y ) β − 1 z α + β − 1 e − z \begin{aligned}
f_{Y, Z}(y, z) &= f_{X_1}(yz)f_{X_2}(z(1-y)) \\
&= \frac 1 {\Gamma(\alpha)} (yz)^{\alpha -1} e^{-yz} \frac 1 {\Gamma(\beta)} \{z(1-y)\}^{\beta -1} e^{-z(1-y)} \\
&= \frac 1 {\Gamma(\alpha) \Gamma(\beta)} y^{\alpha-1} (1-y)^{\beta - 1} z^{\alpha + \beta - 1} e^{-z}
\end{aligned} f Y , Z ( y , z ) = f X 1 ( yz ) f X 2 ( z ( 1 − y )) = Γ ( α ) 1 ( yz ) α − 1 e − yz Γ ( β ) 1 { z ( 1 − y ) } β − 1 e − z ( 1 − y ) = Γ ( α ) Γ ( β ) 1 y α − 1 ( 1 − y ) β − 1 z α + β − 1 e − z 가 된다. 이제, Y Y Y 의 주변부 확률밀도함수를 구하면,
f Y ( y ) = ∫ z f Y , Z ( y , z ) d z = ∫ 0 ∞ 1 Γ ( α ) Γ ( β ) y α − 1 ( 1 − y ) β − 1 z α + β − 1 e − z d z = 1 Γ ( α ) Γ ( β ) y α − 1 ( 1 − y ) β − 1 ∫ 0 ∞ z α + β − 1 e − z d z Γ ( α + β ) 함수의 정의 = Γ ( α + β ) Γ ( α ) Γ ( β ) B ( α , β ) 의 역수 y α − 1 ( 1 − y ) β − 1 = 1 B ( α , β ) y α − 1 ( 1 − y ) β − 1 , 0 ≤ y ≤ 1 \begin{aligned}
f_Y(y) &= \int_z f_{Y, Z}(y, z) dz \\
&= \int_0^{\infty} \frac 1 {\Gamma(\alpha) \Gamma(\beta)} y^{\alpha-1} (1-y)^{\beta - 1} z^{\alpha + \beta - 1} e^{-z} dz \\
&= \frac 1 {\Gamma(\alpha) \Gamma(\beta)} y^{\alpha-1} (1-y)^{\beta - 1} \underset{\Gamma(\alpha + \beta)\text{함수의 정의}}{\boxed{\int_0^\infty z^{\alpha + \beta - 1} e^{-z} dz}} \\
&= \underset{\Beta(\alpha, \beta)\text{의 역수}}{\boxed{\frac {\Gamma(\alpha + \beta)}{\Gamma(\alpha)\Gamma(\beta)}}} y^{\alpha-1} (1-y)^{\beta - 1} \\
&= \frac 1 {\Beta(\alpha, \beta)} y^{\alpha-1} (1-y)^{\beta - 1}, 0 \leq y \leq 1
\end{aligned} f Y ( y ) = ∫ z f Y , Z ( y , z ) d z = ∫ 0 ∞ Γ ( α ) Γ ( β ) 1 y α − 1 ( 1 − y ) β − 1 z α + β − 1 e − z d z = Γ ( α ) Γ ( β ) 1 y α − 1 ( 1 − y ) β − 1 Γ ( α + β ) 함수의 정의 ∫ 0 ∞ z α + β − 1 e − z d z = B ( α , β ) 의 역수 Γ ( α ) Γ ( β ) Γ ( α + β ) y α − 1 ( 1 − y ) β − 1 = B ( α , β ) 1 y α − 1 ( 1 − y ) β − 1 , 0 ≤ y ≤ 1 가 된다.
기댓값과 분산 ¶ 베타 분포의 기댓값과 분산은 다음과 같다.
E ( X ) = α α + β V a r ( X ) = α β ( α + β ) 2 ( α + β + 1 ) \begin{gathered}
\mathbb E (X) = \frac {\alpha}{\alpha + \beta} \\
\\
Var(X) = \frac{\alpha \beta}{(\alpha+\beta)^2(\alpha + \beta + 1)}
\end{gathered} E ( X ) = α + β α Va r ( X ) = ( α + β ) 2 ( α + β + 1 ) α β 확률밀도함수의 형태 ¶ 베타 분포는 α , β < 1 \alpha, \beta < 1 α , β < 1 이면 U U U 자 형태, ( α − 1 ) ( β − 1 ) < 0 (\alpha - 1)(\beta - 1) < 0 ( α − 1 ) ( β − 1 ) < 0 이면 J J J 자 형태를 가지며, 나머지 경우에는 모두 단조형태를 가진다.
이항 분포와의 관계 ¶ B ( n , p ) B(n, p) B ( n , p ) 의 분포함수는 B e t a ( k + 1 , n − k ) Beta (k + 1, n - k) B e t a ( k + 1 , n − k ) 의 우측 꼬리확률이 된다. 즉, X ∼ B ( n , p ) X \sim B(n, p) X ∼ B ( n , p ) 이고, Y ∼ B e t a ( k + 1 , n − k ) Y \sim Beta(k+1, n-k) Y ∼ B e t a ( k + 1 , n − k ) 일 때,
P [ Y ≥ p ] = P [ X ≤ k ] P[ Y \geq p ] = P [X \leq k] P [ Y ≥ p ] = P [ X ≤ k ] 가 성립한다. 이때, k k k 는 1보다 큰 자연수이다.
Y ∼ b e t a ( k + 1 , n − k ) Y \sim beta(k + 1, n-k) Y ∼ b e t a ( k + 1 , n − k ) 의 꼬리확률 P ( Y ≥ p ) P(Y \geq p) P ( Y ≥ p ) 은 다음과 같다.
∫ p 1 Γ ( n + 1 ) Γ ( k + 1 ) Γ ( n − k ) y k ( 1 − y ) n − k − 1 d y = Γ ( n + 1 ) Γ ( k + 1 ) Γ ( n − k ) [ ∫ p ∞ y k ( 1 − y ) n − k − 1 d y ] = Γ ( n + 1 ) Γ ( k + 1 ) Γ ( n − k ) [ y k ( 1 − y ) n − k 1 n − k ( − 1 ) ∣ p 1 + ∫ p 1 k n − k y k − 1 ( 1 − y ) n − k d y ] 부분적분 = n ! k ! ( n − k − 1 ) ! 1 n − k p k ( 1 − p ) n − k + n ! ( k − 1 ) ! ( n − k ) ! ∫ p 1 y k − 1 ( 1 − y ) n − k d y = n ! k ! ( n − k ) ! p k ( 1 − p ) n − k + n ! ( k − 1 ) ! ( n − k ) ! [ y k − 1 ( 1 − y ) n − k + 1 1 n − k + 1 ( − 1 ) ∣ p 1 + ∫ p 1 k − 1 n − k + 1 y k − 2 ( 1 − y ) n − k + 1 d y ] = n ! k ! ( n − k ) ! p k ( 1 − p ) n − k + n ! ( k − 1 ) ! ( n − k + 1 ) ! p k − 1 ( 1 − p ) n − k + 1 + n ! ( k − 2 ) ! ( n − k + 1 ) ! ∫ p 1 y k − 2 ( 1 − y ) n − k + 1 d y = … = ( n k ) p k ( 1 − p ) n − k + ( n k − 1 ) p k − 1 ( 1 − p ) n − k + 1 + ( n k − 2 ) p k − 2 ( 1 − p ) n − k + 2 + ⋯ + ( n 0 ) p 0 ( 1 − p ) n = ∑ x = 0 k ( n x ) p x ( 1 − p ) n − x = P ( X ≤ k ) \begin{aligned}
\int_p^1 \frac{\Gamma(n+1)}{\Gamma(k+1)\Gamma(n-k)} y^{k} (1-y)^{n-k-1} dy &= \frac{\Gamma(n+1)}{\Gamma(k+1)\Gamma(n-k)} \big[ \int_p^\infty y^{k} (1-y)^{n-k-1} dy \big] \\
&= \frac{\Gamma(n+1)}{\Gamma(k+1)\Gamma(n-k)} \underset{\text{부분적분}}{\boxed{\big[ y^k (1-y)^{n-k} \frac 1 {n-k} (-1) \big|_p^1 + \int_p^1 \frac k {n-k} y^{k-1} (1-y)^{n-k} dy \big] }}\\
&= \frac{n!}{k! (n-k-1)!} \frac 1 {n-k} p^k (1-p)^{n-k} + \frac{n!}{(k-1)!(n-k)!} \int_p^1 y^{k-1} (1-y)^{n-k} dy \\
&= \frac{n!}{k! (n-k)!} p^k (1-p)^{n-k} + \frac{n!}{(k-1)!(n-k)!} \big[ y^{k-1} (1-y)^{n-k+1} \frac 1 {n-k+1} (-1) \big|_p^1 + \int_p^1 \frac {k-1}{n-k+1} y^{k-2} (1-y)^{n-k+1} dy \big] \\
&= \frac{n!}{k! (n-k)!} p^k (1-p)^{n-k} + \frac{n!}{(k-1)!(n-k+1)!} p^{k-1} (1-p)^{n-k+1} + \frac {n!}{(k-2)!(n-k+1)!} \int_p^1y^{k-2} (1-y)^{n-k+1} dy \\
&= \dots \\
&= \binom n k p^k (1-p)^{n-k} + \binom n {k-1} p^{k-1} (1-p)^{n-k+1} + \binom n {k-2} p^{k-2} (1-p)^{n-k+2} + \dots + \binom n 0 p^0 (1-p)^n \\
&= \sum_{x=0}^k \binom n x p^x (1-p)^{n-x} = P(X \leq k)
\end{aligned} ∫ p 1 Γ ( k + 1 ) Γ ( n − k ) Γ ( n + 1 ) y k ( 1 − y ) n − k − 1 d y = Γ ( k + 1 ) Γ ( n − k ) Γ ( n + 1 ) [ ∫ p ∞ y k ( 1 − y ) n − k − 1 d y ] = Γ ( k + 1 ) Γ ( n − k ) Γ ( n + 1 ) 부분적분 [ y k ( 1 − y ) n − k n − k 1 ( − 1 ) ∣ ∣ p 1 + ∫ p 1 n − k k y k − 1 ( 1 − y ) n − k d y ] = k ! ( n − k − 1 )! n ! n − k 1 p k ( 1 − p ) n − k + ( k − 1 )! ( n − k )! n ! ∫ p 1 y k − 1 ( 1 − y ) n − k d y = k ! ( n − k )! n ! p k ( 1 − p ) n − k + ( k − 1 )! ( n − k )! n ! [ y k − 1 ( 1 − y ) n − k + 1 n − k + 1 1 ( − 1 ) ∣ ∣ p 1 + ∫ p 1 n − k + 1 k − 1 y k − 2 ( 1 − y ) n − k + 1 d y ] = k ! ( n − k )! n ! p k ( 1 − p ) n − k + ( k − 1 )! ( n − k + 1 )! n ! p k − 1 ( 1 − p ) n − k + 1 + ( k − 2 )! ( n − k + 1 )! n ! ∫ p 1 y k − 2 ( 1 − y ) n − k + 1 d y = … = ( k n ) p k ( 1 − p ) n − k + ( k − 1 n ) p k − 1 ( 1 − p ) n − k + 1 + ( k − 2 n ) p k − 2 ( 1 − p ) n − k + 2 + ⋯ + ( 0 n ) p 0 ( 1 − p ) n = x = 0 ∑ k ( x n ) p x ( 1 − p ) n − x = P ( X ≤ k ) ■ \blacksquare ■
디리클레 분포와의 관계 ¶ 베타 분포를 다변수로 확장하면 디리클레(Dirichlet) 분포가 된다. 즉, 베타 분포는 α = c 1 \alpha = c_1 α = c 1 , β = c 0 \beta = c_0 β = c 0 인 디리클레 분포와 같다.