정의¶
확률변수는 불확실성을 가지는 확률실험의 발생 가능한 모든 결과(표본공간) 하나하나를 실수값으로 연결하는 함수이다. 함수라는 특성을 가지기 때문에 일반적인 수학식의 표기법에 따라 와 같은 식으로 표기해야하나 통계학에서는 편의상 로 표기한다. 확률변수라는 함수를 통해 관념적으로 존재하는 사건의 개념이 수학적 조작이 가능한 수의 개념으로 바뀐다.
따라서, 확률변수는 불확살한 사건을 수학적으로 다루기 위한 통계학의 가장 기초적이면서 중요한 개념요소라고 할 수 있다.
지시함수와 확률변수¶
확률변수는 함수의 형태가 아닌 지시함수의 적분 형태로 표기할 수 있다.
확률변수 가 라는 값을 가질 때, 를 다음과 같이 지시함수의 적분꼴로 표현할 수 있다.
즉, 의 구간 내에서 라는 기준점을 중심으로 기준점보다 좌측에 있는(더 작은) 영역에서 1, 그렇지 않은 영역에서 0인 값을 가지는 지시함수를 적분하면 가 되는 성질을 이용하여 확률변수를 지시함수의 적분꼴로 나타낼 수 있다.
인 구간에서는 다음 형태로 바뀌며,
영역에서는 다음과 같이 일반화할 수 있다.
확률분포 probability distribution¶
확률변수는 분포를 가진다. 즉, 확률변수가 가질 수 있는 각각의 값은 실현될 수 있는 확률을 가지는데, 이 확률값은 무작위로 나타나는 것이 아니라 체계적으로 구조화되어 있다. 확률변수가 가지는 분포의 형태를 확률분포(probability distribution) 또는 분포(distribution)라고 한다. 확률변수가 가질 수 있는 값이 이산적인지, 구간 내에서 연속적인지에 따라 이산형 확률변수(discrete r.v.)와 연속형 확률변수(continuous r.v.)로 구분할 수 있다.
확률분포는 다음과 같은 성질을 가진다.
이산형 분포에서 확률분포값은 그 점에서의 확률을 의미하는 반면, 연속형 분포에서 한 점의 분포값이 확률을 의미하지 않는다. 이는 연속형 분포에서 적분값의 성질에 따른 귀결로, 직관적으로는 해당 값 주변의 값을 취할 상대적인 가능성이라고 이해할 수 있다.
용어의 정의¶
확률실험(random experiment) : 결과를 예측할 수 없으나 발생 가능한 경우들이 정해진 실험
표본공간(sample space, ) : 확률실험의 결과로 나타날 수 있는 모든 실현치들의 집합