정치학방법론

Week 05

선형 회귀 분석 1: 단순 및 다중 회귀

By Kim Chan Woo

연구의 관점

선형의 세계

진실을 가로지르는 직선 찾기

세상은 수많은 변수들의 얽힘으로 가득 차 있습니다. "경제 성장은 민주주의를 촉진하는가?", "교육 수준은 투표 성향에 어떤 영향을 주는가?"와 같은 거대한 질문에 답하기 위해, 우리는 관계의 규칙성을 찾아야 합니다.

선형회귀분석은 데이터의 숲 사이를 가르는 '가장 곧은 길'을 찾는 과정입니다. 그 직선 위에서 우리는 어제보다 더 정확하게 내일을 예측할 수 있습니다.

관계의 단순화

회귀분석은 복잡한 현실을 '계수(\( \beta \))'라는 단순한 숫자로 치환하여, 사회를 움직이는 메커니즘을 투명하게 드러내는 과학적 렌즈입니다.

계측 모형

모형의 해부학

회귀 방정식

\[ Y = \beta_0 + \beta_1 X + \epsilon \]

\( Y \)

종속변수. 우리가 설명하고 싶은 결과값 (예: 지지율).

\( X \)

독립변수. 결과를 만들어내는 원인 (예: 선거 비용).

\( \epsilon \)

오차항. 모델이 설명하지 못하는 현실의 무작위성.

모형의 구성 요소

회귀 계수

절편과 기울기

\( \beta_0 \) (Intercept, 절편)

\( X \)가 \( 0 \)일 때의 \( Y \)값입니다. 바탕이 되는 기본 지지율 같은 개념입니다.

\( \beta_1 \) (Slope, 기울기)

핵심 중의 핵심입니다. **"\( X \)가 한 단위 증가할 때, \( Y \)가 평균적으로 얼마나 변하는가"**를 나타내며, 영향력의 크기를 의미합니다.

"정치학 연구자에게 기울기(\( \beta \))는 변수 간의 역학 관계를 설명하는 가장 우아한 문장입니다."

모형의 추정

최소자승법 (OLS)

최소자승법: 데이터에 가장 잘 맞는 선 찾기

'최소자승법'은 수많은 점들 사이에서 모든 점들과의 거리(잔차)를 가장 가깝게 만드는 '평형점'을 찾는 기술입니다.

  • 잔차(Residual): 실제 데이터와 나의 예측선 사이의 수직 거리.
  • 최소화: 이 거리들의 제곱을 모두 더했을 때 가장 작은 값이 나오는 직선이 바로 정답입니다.

직관적 이해

수직 점선: 잔차 (Residual) 빨간선: 최소자승 회귀선

수학적으로는 점들에서 선까지의 수직 거리(잔차)의 제곱합을 최소로 만드는 선을 찾는 과정입니다.

평가 지표

적합도

결정계수 (\( R^2 \))

"내가 만든 모델이 현실의 변동성을 몇 퍼센트나 설명하고 있는가?"를 보여주는 지수입니다. \( 0 \)에서 \( 1 \) 사이의 값을 갖습니다.

높은 \( R^2 \)

모델이 데이터에 딱 붙어있음을 의미합니다. 설명력이 높습니다.

낮은 \( R^2 \)

사회과학에서는 \( 0.2 \)만 되어도 의미 있는 발견으로 칩니다. 현실은 한두 가지 변수로 다 설명되지 않기 때문입니다.

통계적 검증

유의수준

기울기는 실재하는가?

계수(\( \beta \))가 숫자로 나왔다고 해서 다 믿으면 안 됩니다. 이 숫자가 우연히 나온 것이 아님을 \( p \)-값으로 검증해야 합니다.

  • Null Hypothesis: \( \beta_1 = 0 \) (영향력이 전혀 없다).
  • Alternative Hypothesis: \( \beta_1 \neq 0 \) (실제 영향력이 있다).
  • 보통 \( p < 0.05 \)일 때 계수 옆에 별(\( * \))을 붙여 '유의미함' 을 축하합니다.

기술적 진단

회귀분석의 가정

4대 기본 가정 (LINE)

1. Linearity (선형성)

\( X \)와 \( Y \)가 어느 정도 직선 관계여야 합니다.

2. Independence (독립성)

오차들이 서로 영향을 주면 안 됩니다.

3. Normality (정규성)

오차항(\( \epsilon \))의 분포가 예쁜 종 모양이어야 합니다.

4. Equal Variance (등분산성)

오차가 \( X \)의 크기에 상관없이 골고루 퍼져 있어야 합니다.

실용 분석

파이썬 분석 단계

Python을 활용한 회귀분석

import statsmodels.formula.api as smf # 1. 모델 설정 (투표율 ~ 선거비용) model = smf.ols('support_rate ~ spending', data=df).fit() # 2. 결과 요약 보고서 출력 print(model.summary())

시각화

회귀선 그리기

회귀 분석 시각화

독립변수 (X) 종속변수 (Y)

산점도 위로 지나가는 회귀선은 데이터의 '중심축'을 시각화합니다. 선 주변의 반투명한 영역은 예측의 불확실성(신뢰구간)을 나타냅니다.

Check Point:

실제 데이터(점)가 회귀선에 얼마나 가깝게 밀집되어 있느냐가 설명력(\( R^2 \))의 핵심입니다.

코드 예시: sns.regplot(x='X', y='Y', data=df)

해석의 실제

정치적 사례 적용

선거 비용과 득표율의 관계

연구 결과 해석

분석 결과: 선거 비용(\( X \))의 계수가 \( 1.5 \)이고 \( p \)-값이 \( 0.001 \)이라면?

  • 학술적 서술 예시:
    "회귀 분석 결과, 선거 비용 지출은 득표율에 정(+)의 방향으로 유의미한 영향을 미치는 것으로 나타났다(\( p < 0.01 \)). 구체적으로 선거 비용이 1억 원 증가할 때마다 득표율은 평균적으로 1.5%포인트 상승하는 것으로 예측된다."

체크리스트

프로 연구자의 관점

이 결과, 믿어도 될까?

1. 유의미한가? (\( p \)-value)

우연일 확률이 \( 5\% \) 미만인지 확인하십시오.

2. 얼마나 설명하는가? (\( R^2 \))

사회과학에서는 \( 0.1 \sim 0.3 \)만 되어도 훌륭한 설명력입니다.

3. 원인과 결과가 명확한가?

선후 관계와 제3의 변수(예: 날씨, 정당 정체성)를 고려했는지 스스로 질문하십시오.

상호작용

학습 챌린지

결과 수치 해석하기

연구 결과: \( \text{Voting Rate} = 5.2 + 0.8 \times \text{Education} \) (\( p=0.01 \))

이 모델에 따르면 교육 연수가 10년 늘어날 때 투표율은 어떻게 변합니까?

  • 1. 5.2%포인트 감소한다.
  • 2. 8%포인트 증가한다. (\( 10 \text{년} \times 0.8 \))
  • 3. 아무런 변화가 없다.
정답: 2번. 계수(0.8)는 단위 변화량을 뜻합니다. 유의미한 결과이므로 실제 효과로 해석합니다.

상호작용

시각적 문해력

잔차의 패턴 확인하기

상황: 회귀분석 후 잔차(오차)를 그려보니 특정한 패턴(예: 곡선 모양)이 보입니다. 이 모델은 안전할까요?

정답: 아니요. 패턴이 있다는 것은 모델이 놓치고 있는 정보가 있다는 뜻입니다. 선형성 가정이 깨졌을 확률이 높습니다.

요약

이번 주 정리

오늘 학습한 핵심 내용

  • Linearity: 현실의 복잡함을 직선의 미학으로 요약한다.
  • OLS: 잔차의 제곱합을 최소화하는 최적의 위치를 찾는다.
  • Interpretation: 계수는 '한 단위의 가치'를 의미한다.
  • P-Value & R-Squared: 얼마나 유의미한지, 얼마나 잘 설명하는지 확인한다.
  • Causality Warning: 통계는 관계만 보여줄 뿐, 원인은 연구자가 논리로 채워야 한다.
1 / 31