정치학방법론

Week 04

가설 검정 및 두 집단 비교

By Kim Chan Woo

서론

특별 보고

우연을 넘어: 침묵을 깨는 과학

세상의 많은 발견은 사소한 '차이'에서 시작됩니다. "남성과 여성의 투표율이 다르다", "제도 변화 후 지지율이 올랐다"는 주장은 흥미롭지만, 그것이 단순한 우연(Chance)인지 아닌지를 밝히는 것은 과학의 영역입니다.

가설검정은 데이터라는 법정에서 '우연'이라는 피고인과 싸워 '필연'을 입증하는 정교한 논리 체계입니다. 우리는 이번 주, 그 입증의 기술을 배웁니다.

추론의 논리

통계적 유의미함은 단순히 숫자가 크다는 뜻이 아닙니다. 그것은 우리가 관찰한 현상이 '데이터의 노이즈'를 뚫고 나올 만큼 강력한 실체라는 선언입니다.

연구 논리

법정의 비유

귀무가설(\( H_0 \)): 입증 전까지는 무죄

귀무가설 (Null Hypothesis)

"아무런 일도 일어나지 않았다", "두 집단 간의 차이는 없다"는 기본 상태입니다. 통계적 법정에서는 이 가설이 '참'이라고 전제하고 시작합니다.

대립가설 (Alternative Hypothesis, \( H_1 \))

연구자가 진짜로 증명하고 싶은 새로운 주장입니다. "두 집단 간에는 분명한 차이가 존재한다"는 가설입니다.

우리는 \( H_1 \)을 직접 증명하는 것이 아니라, \( H_0 \)가 일어날 확률이 너무나 희박함을 보여줌으로써 \( H_0 \)를 기각(Reject)하고 간접적으로 \( H_1 \)을 채택합니다.

확률과 유의성

P-Value 가이드

P-Value란 무엇인가?

"귀무가설(\( H_0 \))이 참이라는 가정하에, 현재와 같은 극단적인 데이터가 관찰될 확률."

  • \( p < 0.05 \): "이런 일은 우연히 일어날 확률이 \( 5\% \)도 안 돼! 따라서 우연이 아니라 실제 효과가 있다고 판단하자."
  • Statistically Significant: \( p \)-값이 기준치(\( \alpha \))보다 낮을 때 우리는 이 결과가 '통계적으로 유의미하다'고 말합니다.

유의수준의 임계치

사회과학의 표준은 \( 0.05 \)이지만, 더 엄밀한 연구에서는 \( 0.01 \)이나 \( 0.001 \)을 기준으로 삼기도 합니다.

오류 검정

잘못된 판단의 대가

제1종 오류와 제2종 오류

결정 \( H_0 \)가 참일 때 (효과 없음) \( H_1 \)가 참일 때 (실제 효과 있음)
\( H_0 \) 기각 제1종 오류 (\( \alpha \))
없는 효과가 있다고 오판
올바른 결정 (검정력)
\( H_0 \) 채택 (기각 실패) 올바른 결정 (신뢰 수준) 제2종 오류 (\( \beta \))
있는 효과를 놓침

Trade-off: \( \alpha \)를 강하게 낮추면 무고한 사람을 벌주지는 않지만(\( \alpha \)), 진짜 범인을 놓치기(\( \beta \)) 쉬워집니다.

분석 방법론

두 집단 비교

T-검정: 평균의 비교

두 집단의 평균 차이가 통계적으로 유의미한지 확인하는 가장 표준적인 방법입니다. 핵심은 "평균의 차이가 오차에 비해 충분히 큰가?"를 보는 것입니다.

T-통계량의 직관

\[ t = \frac{\bar{x}_1 - \bar{x}_2}{SE} \]

핵심 원리:
1. 분자(차이)가 클수록
2. 분모(표준오차)가 작을수록
T값은 커지고 유의미해집니다!

  • 표본 수(\( n \)): 학생 수가 많아지면 오차(\( SE \))는 줄어듭니다.
  • 변동성(\( s \)): 데이터가 고르게 모여있을수록 차이 입증이 쉽습니다.
  • Result: 수식 계산은 컴퓨터에 맡기고, 우리는 이 '오차 대비 차이'의 비율에 집중합니다.

통계 심화

T-분포의 직관

왜 T-분포인가?

표본의 크기가 작으면 우리의 예측은 더 불안정해집니다. T-분포는 정규분포보다 양쪽 꼬리가 더 두껍습니다.

"극단적인 일이 벌어질 확률을 더 넉넉하게 잡아주는 배려입니다."

Normal vs T-distribution

[시각화: 정규분포 vs 꼬리가 두꺼운 T-분포]

기본 가정

통계적 전제 조건

당신의 검정은 유효한가?

\( T \)-검정을 돌리기 전에는 세 가지 가정이 충족되는지 확인해야 합니다. 가정이 무너지면 결과도 신뢰할 수 없습니다.

  • Independence: 두 집단의 표본은 서로 영향을 주지 않아야 합니다.
  • Normality: 각 집단의 데이터 분포가 종 모양(정규분포)을 따라야 합니다. (표본이 크면(\( n > 30 \)) 어느 정도 극복 가능)
  • Homogeneity of Variance: 두 집단의 흩어진 정도(분산)가 비슷해야 합니다. (다를 경우 Welch's \( T \)-test를 사용)

실용 분석

파이썬 실습

Python을 활용한 T-검정

from scipy import stats # 1. 두 집단의 데이터 준비 # (Google Colab에서 즉시 실행 가능합니다) group_a = [3.2, 3.4, 3.1, 3.5] group_b = [3.8, 3.7, 3.9, 3.6] # 2. T-검정 실행 (단 1줄!) t_stat, p_val = stats.ttest_ind(group_a, group_b) # 3. 결과 확인 print(f"P-value: {p_val:.4f}")

* Scipy 라이브러리는 별도의 설치 없이 Colab에서 바로 작동합니다.

결과 해석

신뢰구간

범위를 통한 추정

점 하나로 예측하는 것보다, 일정 '범위'로 예측하는 것이 훨씬 과학적입니다. 이것이 신뢰구간(Confidence Intervals)입니다.

구간의 범위

\[ \text{CI} = \bar{x} \pm z \times \frac{s}{\sqrt{n}} \]

\( \bar{x} \): 표본 평균
\( z \): 신뢰계수 (임계값)
\( s \): 표본 표준편차
\( n \): 표본 크기

신뢰구간 안에 \( 0 \)이 포함되어 있다면, 두 집단의 차이는 없는 것이나 마찬가지입니다.

사례 연구

현실 세계의 적용

성별과 정책 지지

연구 문제

"기초연금 확대 정책에 대해 남성과 여성의 지지율은 정말 차이가 날까?"

  • 관측치(Observation): 남성 평균 \( 3.2 \)점, 여성 평균 \( 3.5 \)점.
  • 결과(Result): \( p \)-값이 \( 0.003 \)으로 계산됨.
  • 학술적 서술 예시:
    "가설 검정 결과, 성별에 따른 정책 지지도 차이는 통계적으로 유의미한 것으로 나타났다(\( p < 0.01 \)). 따라서 남성보다 여성이 해당 정책을 더 긍정적으로 평가한다는 결론을 내릴 수 있다."

비판적 사고

과학적 정직성

P-Hacking의 함정

P-해킹(P-Hacking)이란?

유의미한 결과가 나올 때까지 데이터를 자르고 붙이거나 여러 요인을 돌려보는 행위입니다. 이는 과학적 사기(Fraud)에 가깝습니다.

정직한 연구

분석 전 미리 가설을 등록하고(Pre-registration), 유의미하지 않은 결과(\( Null\ Findings \))도 솔직하게 보고하는 자세가 좋은 학자를 만듭니다.

상호작용

퀴즈 01

귀무가설인가, 대립가설인가?

"유권자들이 TV 토론을 보고 나서 후보에 대한 생각이 바뀌었는지 알고 싶다." 이 연구의 귀무가설(\( H_0 \))은?

  • 1. TV 토론은 효과가 매우 컸다.
  • 2. TV 토론 전과 후의 지지도 차이는 \( 0 \)이다 (아무 효과 없었다).
  • 3. 바뀐 사람도 있고 안 바뀐 사람도 있다.
정답: 2번. 귀무가설은 항상 "차이가 없다"는 보수적인 가정이 기본값입니다.

상호작용

퀴즈 02

P-Value 마스터

상황: 지지율 분석 보고서에 \( p = 0.04 \)라고 적혀 있습니다. 어떤 결론을 내려야 할까요?

정답: 통계적으로 유의미함. (표준 \( 0.05 \) 기준 미만이므로 우연일 확률이 낮아 귀무가설을 기각합니다.)

심화 개념

가정이 깨졌을 때

비모수 검정 (Non-parametric)

정규분포가 아닐 때의 해법

T-검정은 데이터가 종 모양(정규분포)이라는 가정이 필요합니다. 하지만 표본이 너무 적거나 분포가 엉망이라면?

맨-휘트니 U 검정 (Mann-Whitney U)

수치 대신 **'순위(Rank)'**를 매겨 비교합니다. 평균보다 '누가 더 앞서나'를 따지는 매우 튼튼한(Robust) 방법입니다.

예시: 소규모 학위 과정(각 5명)의 만족도를 비교할 때, 데이터가 정규분포를 따르지 않거나 극단적인 이상치가 있는 경우 순위합을 통해 비교합니다.

연구 설계

얼마나 필요한가?

검정력 분석 (Power Analysis)

차이를 놓치지 않을 확률

검정력(\( 1-\beta \))은 "진짜 차이가 있을 때 이를 유의미하다고 잡아낼 능력"입니다.

핵심 지침: 효과가 아주 미세하다면, 그것을 입증하기 위해 더 많은 표본(Sample Size)이 필요합니다. "낚시할 물고기가 작을수록 더 촘촘한 그물이 필요한 것과 같습니다."

예시: 선거에서 두 후보의 지지율 차이가 0.5%p 내외로 아주 정밀한 차이라면, 이를 통계적으로 유의미하게 포착하기 위해 수만 명 단위의 대규모 조사가 필요합니다.

요약

이번 주 정리

4주차 학습 내용 정리

  • 가정: 우선 "차이가 없다"(\( H_0 \))고 믿고 시작한다.
  • 입증: 데이터가 "이건 우연이기 힘들다"(\( p < 0.05 \))고 외칠 때 가설을 채택한다.
  • 도구: 정규분포면 T-검정, 아니면 비모수 검정(순위 방식)을 쓴다.
  • 설계: 확실한 증명을 원한다면 충분한 표본 크기를 확보해야 한다(검정력).
1 / 31