세상의 많은 발견은 사소한 '차이'에서 시작됩니다. "남성과 여성의 투표율이 다르다", "제도 변화 후 지지율이 올랐다"는 주장은 흥미롭지만, 그것이 단순한 우연(Chance)인지 아닌지를 밝히는 것은 과학의 영역입니다.
가설검정은 데이터라는 법정에서 '우연'이라는 피고인과 싸워 '필연'을 입증하는 정교한 논리 체계입니다. 우리는 이번 주, 그 입증의 기술을 배웁니다.
통계적 유의미함은 단순히 숫자가 크다는 뜻이 아닙니다. 그것은 우리가 관찰한 현상이 '데이터의 노이즈'를 뚫고 나올 만큼 강력한 실체라는 선언입니다.
"아무런 일도 일어나지 않았다", "두 집단 간의 차이는 없다"는 기본 상태입니다. 통계적 법정에서는 이 가설이 '참'이라고 전제하고 시작합니다.
연구자가 진짜로 증명하고 싶은 새로운 주장입니다. "두 집단 간에는 분명한 차이가 존재한다"는 가설입니다.
우리는 \( H_1 \)을 직접 증명하는 것이 아니라, \( H_0 \)가 일어날 확률이 너무나 희박함을 보여줌으로써 \( H_0 \)를 기각(Reject)하고 간접적으로 \( H_1 \)을 채택합니다.
"귀무가설(\( H_0 \))이 참이라는 가정하에, 현재와 같은 극단적인 데이터가 관찰될 확률."
사회과학의 표준은 \( 0.05 \)이지만, 더 엄밀한 연구에서는 \( 0.01 \)이나 \( 0.001 \)을 기준으로 삼기도 합니다.
| 결정 | \( H_0 \)가 참일 때 (효과 없음) | \( H_1 \)가 참일 때 (실제 효과 있음) |
|---|---|---|
| \( H_0 \) 기각 | 제1종 오류 (\( \alpha
\)) 없는 효과가 있다고 오판 |
올바른 결정 (검정력) |
| \( H_0 \) 채택 (기각 실패) | 올바른 결정 (신뢰 수준) | 제2종 오류 (\( \beta
\)) 있는 효과를 놓침 |
Trade-off: \( \alpha \)를 강하게 낮추면 무고한 사람을 벌주지는 않지만(\( \alpha \)), 진짜 범인을 놓치기(\( \beta \)) 쉬워집니다.
두 집단의 평균 차이가 통계적으로 유의미한지 확인하는 가장 표준적인 방법입니다. 핵심은 "평균의 차이가 오차에 비해 충분히 큰가?"를 보는 것입니다.
\[ t = \frac{\bar{x}_1 - \bar{x}_2}{SE} \]
핵심 원리:
1. 분자(차이)가 클수록
2. 분모(표준오차)가 작을수록
→ T값은 커지고 유의미해집니다!
표본의 크기가 작으면 우리의 예측은 더 불안정해집니다. T-분포는 정규분포보다 양쪽 꼬리가 더 두껍습니다.
"극단적인 일이 벌어질 확률을 더 넉넉하게 잡아주는 배려입니다."
[시각화: 정규분포 vs 꼬리가 두꺼운 T-분포]
\( T \)-검정을 돌리기 전에는 세 가지 가정이 충족되는지 확인해야 합니다. 가정이 무너지면 결과도 신뢰할 수 없습니다.
* Scipy 라이브러리는 별도의 설치 없이 Colab에서 바로 작동합니다.
점 하나로 예측하는 것보다, 일정 '범위'로 예측하는 것이 훨씬 과학적입니다. 이것이 신뢰구간(Confidence Intervals)입니다.
\[ \text{CI} = \bar{x} \pm z \times \frac{s}{\sqrt{n}} \]
신뢰구간 안에 \( 0 \)이 포함되어 있다면, 두 집단의 차이는 없는 것이나 마찬가지입니다.
"기초연금 확대 정책에 대해 남성과 여성의 지지율은 정말 차이가 날까?"
"가설 검정 결과, 성별에 따른 정책 지지도 차이는 통계적으로 유의미한 것으로 나타났다(\( p < 0.01 \)). 따라서 남성보다 여성이 해당 정책을 더 긍정적으로 평가한다는 결론을 내릴 수 있다."
유의미한 결과가 나올 때까지 데이터를 자르고 붙이거나 여러 요인을 돌려보는 행위입니다. 이는 과학적 사기(Fraud)에 가깝습니다.
분석 전 미리 가설을 등록하고(Pre-registration), 유의미하지 않은 결과(\( Null\ Findings \))도 솔직하게 보고하는 자세가 좋은 학자를 만듭니다.
"유권자들이 TV 토론을 보고 나서 후보에 대한 생각이 바뀌었는지 알고 싶다." 이 연구의 귀무가설(\( H_0 \))은?
정답: 통계적으로 유의미함. (표준 \( 0.05 \) 기준 미만이므로 우연일 확률이 낮아 귀무가설을 기각합니다.)
T-검정은 데이터가 종 모양(정규분포)이라는 가정이 필요합니다. 하지만 표본이 너무 적거나 분포가 엉망이라면?
수치 대신 **'순위(Rank)'**를 매겨 비교합니다. 평균보다 '누가 더 앞서나'를 따지는 매우 튼튼한(Robust) 방법입니다.
검정력(\( 1-\beta \))은 "진짜 차이가 있을 때 이를 유의미하다고 잡아낼 능력"입니다.
핵심 지침: 효과가 아주 미세하다면, 그것을 입증하기 위해 더 많은 표본(Sample Size)이 필요합니다. "낚시할 물고기가 작을수록 더 촘촘한 그물이 필요한 것과 같습니다."