다변량 기술통계 — 코드 실습

← BitStat2 Live 홈

변수 하나만 볼 때는 평균·표준편차로 충분하지만, 변수가 둘 이상이면 관계가 핵심입니다. 연속형 두 변수는 산점도와 상관계수로, 연속형 + 범주형 조합은 그룹별 요약통계와 상자 그림으로 살펴봅니다.

1. 산점도와 상관계수 — 연속형 두 변수

두 연속형 변수의 직선 관계 강도는 상관계수 \(r\) 로 요약합니다 (\(-1 \le r \le 1\)).

\[r = \frac{\sum_{i}(x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum_{i}(x_i-\bar{x})^2}\sqrt{\sum_{i}(y_i-\bar{y})^2}}\]

mtcars에서 차량 무게(wt)와 연비(mpg)의 관계를 봅니다.

여러 연속형 변수를 한 번에 보려면 상관계수 행렬을 계산합니다.

2. 그룹별 기술통계와 상자 그림 — 연속형 + 범주형

범주형 변수로 그룹을 나눈 뒤, 그룹마다 연속형 변수의 요약통계를 계산합니다. iris의 품종(Species)별 꽃받침 길이(Sepal.Length)를 봅니다.

3. 연습문제

연습 1 — 상관계수 계산

cor() 함수로 두 변수의 상관계수를 계산하세요.

상관계수 함수는 cor()이고, 두 벡터를 인자로 받습니다: cor(x, y).

r <- cor(x, y)
r

연습 2 — 그룹별 평균

tapply()로 품종별 꽃잎 길이(Petal.Length)의 평균을 계산하세요. 빈칸에는 그룹을 나누는 범주형 변수가 들어갑니다.

iris에서 범주형 변수는 품종을 담은 Species 열입니다.

grp_mean <- tapply(df$Petal.Length, df$Species, mean)
grp_mean