세상은 수많은 변수들의 얽힘으로 가득 차 있습니다. "경제 성장은 민주주의를 촉진하는가?", "교육 수준은 투표 성향에 어떤 영향을 주는가?"와 같은 거대한 질문에 답하기 위해, 우리는 관계의 규칙성을 찾아야 합니다.
선형회귀분석은 데이터의 숲 사이를 가르는 '가장 곧은 길'을 찾는 과정입니다. 그 직선 위에서 우리는 어제보다 더 정확하게 내일을 예측할 수 있습니다.
회귀분석은 복잡한 현실을 '계수(\( \beta \))'라는 단순한 숫자로 치환하여, 사회를 움직이는 메커니즘을 투명하게 드러내는 과학적 렌즈입니다.
\[ Y = \beta_0 + \beta_1 X + \epsilon \]
종속변수. 우리가 설명하고 싶은 결과값 (예: 지지율).
독립변수. 결과를 만들어내는 원인 (예: 선거 비용).
오차항. 모델이 설명하지 못하는 현실의 무작위성.
\( X \)가 \( 0 \)일 때의 \( Y \)값입니다. 바탕이 되는 기본 지지율 같은 개념입니다.
핵심 중의 핵심입니다. **"\( X \)가 한 단위 증가할 때, \( Y \)가 평균적으로 얼마나 변하는가"**를 나타내며, 영향력의 크기를 의미합니다.
"정치학 연구자에게 기울기(\( \beta \))는 변수 간의 역학 관계를 설명하는 가장 우아한 문장입니다."
'최소자승법'은 수많은 점들 사이에서 모든 점들과의 거리(잔차)를 가장 가깝게 만드는 '평형점'을 찾는 기술입니다.
수학적으로는 점들에서 선까지의 수직 거리(잔차)의 제곱합을 최소로 만드는 선을 찾는 과정입니다.
"내가 만든 모델이 현실의 변동성을 몇 퍼센트나 설명하고 있는가?"를 보여주는 지수입니다. \( 0 \)에서 \( 1 \) 사이의 값을 갖습니다.
모델이 데이터에 딱 붙어있음을 의미합니다. 설명력이 높습니다.
사회과학에서는 \( 0.2 \)만 되어도 의미 있는 발견으로 칩니다. 현실은 한두 가지 변수로 다 설명되지 않기 때문입니다.
계수(\( \beta \))가 숫자로 나왔다고 해서 다 믿으면 안 됩니다. 이 숫자가 우연히 나온 것이 아님을 \( p \)-값으로 검증해야 합니다.
\( X \)와 \( Y \)가 어느 정도 직선 관계여야 합니다.
오차들이 서로 영향을 주면 안 됩니다.
오차항(\( \epsilon \))의 분포가 예쁜 종 모양이어야 합니다.
오차가 \( X \)의 크기에 상관없이 골고루 퍼져 있어야 합니다.
산점도 위로 지나가는 회귀선은 데이터의 '중심축'을 시각화합니다. 선 주변의 반투명한 영역은 예측의 불확실성(신뢰구간)을 나타냅니다.
실제 데이터(점)가 회귀선에 얼마나 가깝게 밀집되어 있느냐가 설명력(\( R^2 \))의 핵심입니다.
코드 예시: sns.regplot(x='X', y='Y', data=df)
분석 결과: 선거 비용(\( X \))의 계수가 \( 1.5 \)이고 \( p \)-값이 \( 0.001 \)이라면?
"회귀 분석 결과, 선거 비용 지출은 득표율에 정(+)의 방향으로 유의미한 영향을 미치는 것으로 나타났다(\( p < 0.01 \)). 구체적으로 선거 비용이 1억 원 증가할 때마다 득표율은 평균적으로 1.5%포인트 상승하는 것으로 예측된다."
우연일 확률이 \( 5\% \) 미만인지 확인하십시오.
사회과학에서는 \( 0.1 \sim 0.3 \)만 되어도 훌륭한 설명력입니다.
선후 관계와 제3의 변수(예: 날씨, 정당 정체성)를 고려했는지 스스로 질문하십시오.
연구 결과: \( \text{Voting Rate} = 5.2 + 0.8 \times \text{Education} \) (\( p=0.01 \))
이 모델에 따르면 교육 연수가 10년 늘어날 때 투표율은 어떻게 변합니까?
정답: 아니요. 패턴이 있다는 것은 모델이 놓치고 있는 정보가 있다는 뜻입니다. 선형성 가정이 깨졌을 확률이 높습니다.