연속형 분포 적합 — 코드 실습

← BitStat2 Live 홈

데이터가 어떤 이론적 연속분포(정규·지수 등)를 따르는지 히스토그램 + 밀도곡선, Q-Q 그래프, 적합도 검정의 세 갈래로 확인합니다. 아래 코드 셀은 직접 수정해서 실행할 수 있습니다.

1. 히스토그램 위에 이론적 밀도곡선 겹치기

정규분포의 모수는 표본으로 추정합니다: \(\hat\mu = \bar{x}\), \(\hat\sigma = s\). faithful 내장 데이터의 간헐천 분출 대기시간에 정규분포를 적합해 봅니다.

밀도곡선이 히스토그램의 봉우리를 잘 따라가는지 보세요. faithful$waiting은 봉우리가 두 개라 정규분포 하나로는 잘 안 맞습니다.

2. Q-Q 그래프와 정규성 검정

Q-Q 그래프에서 점이 직선 위에 놓이면 해당 분포에 잘 맞는다는 뜻입니다. Shapiro-Wilk 검정의 p-값이 0.05보다 작으면 “정규분포”라는 귀무가설을 기각합니다.

데이터를 지수분포 난수로 바꾸면 꼬리 쪽 점들이 직선에서 크게 벗어나고 p-값이 급락하는 것을 확인하세요.

3. 연습 — 지수분포 모수 추정과 적합도 검정

지수분포의 rate 모수 \(\lambda\)의 적률 추정량은 표본평균의 역수, \(\hat\lambda = 1/\bar{x}\) 입니다.

연습 1: rate 추정 — 아래 빈칸을 채워 \(\hat\lambda\)를 계산하세요.

표본평균은 mean(x)이고, rate 추정량은 그 역수입니다.

rate_hat <- 1 / mean(x)
rate_hat

연습 2: Kolmogorov-Smirnov 검정의 p-값

추정한 rate로 지수분포 적합도를 ks.test()로 검정하고, 결과에서 p-값을 꺼내세요.

ks.test()의 반환값은 리스트이고, p-값 성분 이름은 p.value입니다: ks_out$p.value.

pval <- ks_out$p.value
pval