본문으로 이동

밀도 추정

위키백과, 우리 모두의 백과사전.
Image
커널 밀도 추정을 이용한 밀도 추정 시연: 파란색 실선은 0과 3을 중심으로 하는 두 가우스 분포의 혼합인 실제 밀도를 나타낸다. 각 프레임마다 분포에서 100개의 표본이 생성되어 빨간색으로 표시된다. 각 표본을 중심으로 회색 가우스 커널이 그려진다. 가우스 분포들을 평균하면 점선으로 표시된 밀도 추정치가 얻어진다.

통계학에서 확률 밀도 추정 또는 단순히 밀도 추정은 관측된 자료를 바탕으로 관측할 수 없는 기저의 확률 밀도 함수추정하는 것이다. 관측할 수 없는 밀도 함수는 큰 모집단이 분포하는 밀도로 간주되며, 자료는 일반적으로 해당 모집단으로부터의 무작위 표본으로 생각한다.[1]

밀도 추정에는 파젠 윈도우벡터 양자화를 포함한 다양한 클러스터 분석 기법 등 여러 접근법이 사용된다. 밀도 추정의 가장 기본적인 형태는 크기를 재조정한 히스토그램이다.

예시

[편집]
Image
p (glu | diabetes=1) (빨간색), p (glu | diabetes=0) (파란색), 및 p (glu) (검은색)의 추정 밀도
Image
p(diabetes=1 | glu)의 추정 확률
Image
p (diabetes=1 | glu)의 추정 확률

당뇨병 발생 기록을 고려해 보자. 다음은 자료 집합 설명에서 그대로 인용한 내용이다:

애리조나주 피닉스 인근에 거주하는 피마족 혈통의 최소 21세 이상 여성 집단을 세계보건기구 기준에 따라 당뇨병 검사를 실시했다. 자료는 미국 국립 당뇨병·소화기·신장 질환 연구소에서 수집하였다. 우리는 532개의 완전한 기록을 사용했다.[2][3]

이 예시에서는 "glu"(혈장 포도당 농도)에 대한 세 가지 밀도 추정치를 생성하는데, 하나는 당뇨병 유무를 조건으로 하고, 두 번째는 당뇨병이 없는 경우를 조건으로 하며, 세 번째는 당뇨병과 무관하게 계산한다. 이어서 당뇨병 조건부 밀도 추정치를 사용하여 "glu"에 대한 당뇨병 조건부 확률을 구한다.

"glu" 자료는 R 언어의 MASS 패키지에서 얻었다.[4] R 내부에서 ?Pima.tr?Pima.te를 입력하면 자료에 대한 더 자세한 설명을 볼 수 있다.

당뇨병 사례에서 "glu"의 평균값은 143.1이고 표준 편차는 31.26이다. 비당뇨병 사례에서 "glu"의 평균은 110.0이고 표준 편차는 24.29이다. 이를 통해 이 자료 집합에서 당뇨병 사례가 더 높은 "glu" 수치와 연관되어 있음을 알 수 있다. 이는 추정 밀도 함수 도표를 통해 더욱 명확해진다.

첫 번째 그림은 p(glu | diabetes=1), p(glu | diabetes=0), p(glu)의 밀도 추정치를 보여준다. 밀도 추정치는 가우스 커널을 사용하는 커널 밀도 추정이다. 즉, 각 데이터 지점에 가우스 밀도 함수를 배치하고, 데이터 범위에 걸쳐 밀도 함수들의 합을 계산한다.

당뇨병 조건부 "glu" 밀도로부터 베이즈 정리를 통해 "glu" 조건부 당뇨병 확률을 얻을 수 있다. 간결함을 위해 이 공식에서 "diabetes"는 "db."로 줄여 쓴다.

두 번째 그림은 추정된 사후 확률 p(diabetes=1 | glu)를 보여준다. 이 자료들에 따르면 "glu" 수치가 높을수록 당뇨병과 관련이 있는 것으로 보인다.

적용 및 목적

[편집]

밀도 추정의 매우 자연스러운 용도는 주어진 자료 집합의 특성을 비공식적으로 조사하는 것이다. 밀도 추정은 자료의 비대칭도나 다봉성(multimodality)과 같은 특성에 대한 가치 있는 지표를 제공한다. 어떤 경우에는 자명하게 참으로 간주할 수 있는 결론을 도출하기도 하지만, 다른 경우에는 추가적인 분석이나 자료 수집의 방향을 제시하는 역할에 그치기도 한다.[5]

Image
검벨 분포에 대한 히스토그램과 밀도 함수[6]

통계학의 중요한 측면은 다른 방법으로 얻었을 수 있는 결론을 설명하고 예시하기 위해 고객에게 자료를 제시하는 것이다. 밀도 추정은 비수학자들도 비교적 쉽게 이해할 수 있다는 단순한 이유로 이러한 목적에 이상적이다.

이변량 자료의 중요한 사례를 포함하여, 탐색적 및 발표 목적으로 밀도 추정을 사용하는 사례를 더 볼 수 있다.[7]

밀도 추정은 이상 탐지 또는 신규성 탐지에도 자주 사용된다.[8] 관측치가 매우 낮은 밀도 영역에 놓여 있다면, 그것은 이상치이거나 새로운 현상일 가능성이 높다.

  • 수문학에서 강우량 및 하천 유량 자료의 히스토그램과 추정 밀도 함수는 확률 분포로 분석되어 그 행동 양식과 발생 빈도를 파악하는 데 사용된다.[9] 예시는 파란색 그림에 나타나 있다.

커널 밀도 추정

[편집]

커널 밀도 추정(Kernel density estimation, KDE)은 통계학에서 확률 밀도 추정을 위해 커널 평활화를 적용한 것이다. 즉, 커널을 가중치로 기반으로 랜덤 변수확률 밀도 함수추정하는 비모수적 방법이다. KDE는 유한한 데이터 샘플을 기반으로 모집단에 대한 추론이 이루어지는 기본적인 데이터 평활화 문제에 답한다. 신호 처리 및 계량 경제학과 같은 일부 분야에서는 일반적으로 현재 형태로 독립적으로 창안한 것으로 알려진 에마누엘 파르젠(Emanuel Parzen) 및 머레이 로젠블라트(Murray Rosenblatt)의 이름을 따서 파르젠-로젠블라트 창(Parzen-Rosenblatt window)법이라고도 한다. 커널 밀도 추정의 유명한 응용 중 하나는 예측 정확도를 향상시킬 수 있는 나이브 베이즈 분류를 사용할 때 데이터의 클래스 조건부 한계 밀도를 추정하는 것이다.

같이 보기

[편집]

각주

[편집]
  1. Alberto Bernacchia, Simone Pigolotti, Self-Consistent Method for Density Estimation, Journal of the Royal Statistical Society Series B: Statistical Methodology, Volume 73, Issue 3, June 2011, Pages 407–422, https://doi.org/10.1111/j.1467-9868.2011.00772.x
  2. Diabetes in Pima Indian Women - R documentation.
  3. Smith, J. W., Everhart, J. E., Dickson, W. C., Knowler, W. C. and Johannes, R. S. (1988). R. A. Greenes (편집). Using the ADAP learning algorithm to forecast the onset of diabetes mellitus. Proceedings of the Symposium on Computer Applications in Medical Care (Washington, 1988) (Los Alamitos, CA): 261–265. PMC 2245318.
  4. Support Functions and Datasets for Venables and Ripley's MASS.
  5. Silverman, B. W. (1986). Density Estimation for Statistics and Data Analysis. Chapman and Hall. ISBN 978-0412246203.
  6. A calculator for probability distributions and density functions
  7. Geof H., Givens (2013). Computational Statistics. Wiley. p. 330. ISBN 978-0-470-53331-4.
  8. Pimentel, Marco A.F.; Clifton, David A.; Clifton, Lei; Tarassenko, Lionel (2014년 1월 2일). A review of novelty detection. Signal Processing 99 (June 2014): 215–249. doi:10.1016/j.sigpro.2013.12.026.
  9. An illustration of histograms and probability density functions

출처

외부 링크

[편집]