단변량 기술통계 — 코드 실습

← BitStat2 Live 홈

변수 하나를 요약하는 것이 기술통계의 출발점입니다. 변수가 연속형이면 평균·중앙값·표준편차 같은 수치 요약과 히스토그램·상자그림을, 범주형이면 빈도표와 막대그래프를 사용합니다.

1. 연속형 변수 — 수치 요약

faithful 데이터의 간헐천 대기시간(waiting)을 요약해 봅시다. 평균과 중앙값이 다르면 분포가 한쪽으로 치우쳤다는 신호입니다.

표준편차 \(s\)는 관측값이 평균에서 평균적으로 얼마나 떨어져 있는지 나타냅니다:

\[s = \sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2}\]

2. 연속형 변수 — 히스토그램과 상자그림

같은 변수를 그림으로 봅시다. bins 값을 바꾸면 분포의 모양이 어떻게 달리 보이는지 확인하세요.

3. 범주형 변수 — 빈도와 비율

mtcars의 실린더 수(cyl)는 4·6·8 세 범주뿐이므로 범주형으로 다룹니다. 빈도표(table)와 비율표(prop.table)가 기본 도구입니다.

4. 연습 — 중앙값 구하기

mtcars의 연비(mpg)에서 중앙값을 구하는 빈칸을 채우세요.

중앙값을 구하는 R 함수 이름은 영어 그대로 median 입니다.

x <- mtcars$mpg
med <- median(x)
med

5. 연습 — 비율표 만들기

빈도표 freq비율표로 바꾸는 빈칸을 채우세요. 비율의 합은 1이 되어야 합니다.

prop.table(freq) 또는 freq / sum(freq) — 둘 다 같은 비율표를 만듭니다.

freq <- table(mtcars$cyl)
prop <- prop.table(freq)
prop