단변량 기술통계 — 코드 실습
변수 하나를 요약하는 것이 기술통계의 출발점입니다. 변수가 연속형이면 평균·중앙값·표준편차 같은 수치 요약과 히스토그램·상자그림을, 범주형이면 빈도표와 막대그래프를 사용합니다.
1. 연속형 변수 — 수치 요약
faithful 데이터의 간헐천 대기시간(waiting)을 요약해 봅시다. 평균과 중앙값이 다르면 분포가 한쪽으로 치우쳤다는 신호입니다.
표준편차 \(s\)는 관측값이 평균에서 평균적으로 얼마나 떨어져 있는지 나타냅니다:
\[s = \sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2}\]
2. 연속형 변수 — 히스토그램과 상자그림
같은 변수를 그림으로 봅시다. bins 값을 바꾸면 분포의 모양이 어떻게 달리 보이는지 확인하세요.
3. 범주형 변수 — 빈도와 비율
mtcars의 실린더 수(cyl)는 4·6·8 세 범주뿐이므로 범주형으로 다룹니다. 빈도표(table)와 비율표(prop.table)가 기본 도구입니다.
4. 연습 — 중앙값 구하기
mtcars의 연비(mpg)에서 중앙값을 구하는 빈칸을 채우세요.
중앙값을 구하는 R 함수 이름은 영어 그대로 median 입니다.
x <- mtcars$mpg
med <- median(x)
med5. 연습 — 비율표 만들기
빈도표 freq를 비율표로 바꾸는 빈칸을 채우세요. 비율의 합은 1이 되어야 합니다.
prop.table(freq) 또는 freq / sum(freq) — 둘 다 같은 비율표를 만듭니다.
freq <- table(mtcars$cyl)
prop <- prop.table(freq)
prop