사회과학의 고전적인 질문들은 오랫동안 직관과 철학의 영역에 머물러 있었습니다. "사람들은 왜 보수화되는가?", "정치적 갈등은 어떻게 해결되는가?" 등의 질문에 대해 과거의 학자들은 거대 담론으로 답하곤 했습니다.
하지만 오늘날 우리는 이 질문들에 대해 숫자와 증거로 대답할 수 있는 시대를 살고 있습니다. 계량분석은 단순히 통계를 계산하는 행위가 아니라, 복잡하게 얽힌 사회 현상을 객관적인 관찰 단위로 해체하고 재구성하여 '보편적 진실'에 다가가는 과정입니다.
직관(Intuition)에서 증거(Evidence)로의 전환은 사회과학의 권위를 높이고 실질적인 정책 대안을 제시하는 핵심 엔진이 되었습니다. 우리는 이번 학기, 그 엔진의 설계도를 배우게 됩니다.
연구자의 개인적 편향(Bias)이나 가치관을 배제하고, 누가 분석하더라도 동일한 데이터에서 동일한 결과가 도출될 수 있는 '상호 주관적 검증 가능성'을 확보합니다.
단편적인 사례(Anecdote)를 넘어 수천 명, 수만 명의 대규모 데이터를 조망함으로써 사회 전체의 거시적인 흐름과 패턴을 한눈에 파악할 수 있는 시야를 제공합니다.
"많다", "적다"는 모호한 표현 대신 "비율이 \( 15\% \) 증가했다"는 정밀한 수치로 현상을 기술하여 논의의 명확성을 비약적으로 높입니다.
이것은 표면적인 언론 보도와 개인적인 경험, 혹은 세대 간의 고정관념에 기반한 '일반화의 오류'일 가능성이 매우 높습니다.
연령대별 투표율과 이슈별 반응 속도를 시계열 데이터로 분석하면, 단순히 무관심한 것이 아니라 '효능감'에 기초한 매우 전략적이고 역동적인 참여 패턴이 발견됩니다.
"사회 현상을 수치화된 데이터(Numerical Data)를 기반으로 분석하고, 통계적 방법을 활용하여 가설을 검증하는 체계적 과정."
현재 상태를 왜곡 없이 그대로 보여주는 것입니다. 지지율의 분포나 불평등 지수(\( Gini \))의 높낮이를 정확한 수치로 기술합니다.
'왜' 그런 현상이 일어났는지 원인과 결과의 관계를 규명합니다. 예컨대 경제 성장이 민주화에 미치는 영향을 통계적으로 검증합니다.
축적된 과거 데이터를 모델링하여 미래의 정치적 행태를 추정합니다. 선거 결과 예측 모델이나 갈등 지수 전망이 이에 해당합니다.
특정 정책이나 제도가 도입된 후, 그 목표를 달성했는지 혹은 부작용은 없는지 데이터를 통해 엄밀하게 평가합니다.
훌륭한 요리사가 되기 위해서는 도구 사용법과 재료의 특성을 모두 알아야 합니다.
Garbage In, Garbage Out
아무리 화려한 통계 기법(조리법)을 써도, 기초 데이터(재료)가 오염되어 있다면 그 결과물은 독이 될 뿐입니다.
"소득 수준이 높아지면 인간은 정말 더 보수적으로 변하는가?"
"소셜 미디어는 민주주의를 활성화하는가, 아니면 양극화하는가?"
엑셀이나 데이터베이스처럼 행(Row)과 열(Column)로 딱딱 맞춰진 데이터입니다. 나이, 지지 정당, 소득 수준 등 수치화가 끝난 상태입니다.
정치인의 연설문, 뉴스 본문, 시위 현장의 이미지 등 일정한 형식이 없는 데이터입니다. 과거에는 분석이 어려웠으나 현재는 AI의 주요 먹잇감이 됩니다.
The Frontier: 최근 정치학의 혁신은 '비구조화 데이터'를 어떻게 '구조화 데이터'로 정교하게 변환(Embedding)하느냐에 달려 있습니다.
양적 연구는 관찰 가능한 사회적 사실을 객관적으로 측정하고, 현상들 사이의 일반적인 법칙(Law-like regularities)을 발견하려 합니다.
과거의 정치학은 법률, 헌법 조항, 정부 기구의 배치 등 '공식적 제도'의 구조를 묘사하는 데 집중했습니다.
1950년대 이후, 제도 자체가 아니라 그 안에서 일어나는 '사람들의 행동'에 주목하기 시작했습니다. "투표라는 행위 뒤에는 어떤 심리적 자극과 사회적 배경이 있는가?"를 측정하면서 현대 계량분석이 탄생했습니다.
이 혁명 이후 정치학은 서술적(Descriptive) 학문에서 실증적(Empirical) 과학으로 한 단계 도약하게 됩니다.
질적 연구는 현상의 내면에 숨겨진 의미와 맥락을 탐구하며, 숫자가 담지 못하는 인간의 동기를 추적합니다.
먼저 심층 인터뷰(질적)를 통해 사람들이 정치 갈등을 느끼는 새로운 차원을 발견한 후, 이를 설문 문항으로 만들어 대규모(양적)로 검증합니다.
통계 분석(양적) 결과 도저히 이해되지 않는 이상치(Outlier)가 발견되었을 때, 해당 지역에 직접 가서 그 이유를 분석(질적)하여 보완합니다.
현대의 초일류 연구자들은 숫자와 언어, 두 가지 무기를 모두 자유자재로 다룹니다.
1. Puzzle
연구 질문
2. Theory
가설 설정
3. Data
수집/전처리
4. Model
통계 분석
5. Interpretation
결론 도출
6. Publication
학술적 소통
파이썬을 익히는 것은 단순히 통계 도구를 배우는 것이 아니라, AI 시대의 논리적 사고력을 배양하는 것과 같습니다.
내 컴퓨터 성능에 구애받지 않습니다. 구글 클라우드 서버에서 Python을 돌리므로 브라우저만 있으면 즉시 시작할 수 있습니다.
수백만 건의 텍스트를 처리하거나 인공신경망을 학습시킬 때 필요한 고사양 그래픽카드(GPU)를 구글이 무상으로 대여해줍니다.
분석 코드와 결과물을 구글 문서처럼 실시간으로 공유하고 공동 작업할 수 있어 팀 프로젝트에 최적화되어 있습니다.
연구에 대한 설명, 제목, 주석을 적는 영역입니다. 글을 쓰듯 연구의 맥락과 가설을 기록합니다.
실제 Python 코드를 입력하고 실행하는 영역입니다. 왼쪽의 재생[▶] 버튼을 누르면 그 즉시 연산 결과가 아래에 출력됩니다.
"전통적인 '프로그래밍'과 '문서 작성'이 하나로 합쳐진 형태를 Jupyter Notebook이라고 부르며, Colab은 이를 클라우드화한 것입니다."
웹 브라우저에서 작업하지만, 내 소중한 데이터 파일은 구글 드라이브(Hard Drive)에 안전하게 보관됩니다.
데이터 유형을 잘못 지정하면 연산 오류가 발생합니다. 예: 문자열 "100"과 숫자 100은 모양은 같지만 컴퓨터에게는 전혀 다른 존재입니다.
type(variable) 함수를 사용하여 데이터의 혈액형을 수시로 확인하는 습관을 들입시다.
단일 데이터가 아니라, 수많은 유권자의 이름이나 정당 리스트를 하나의 변수에 담아야 할 때 사용합니다.
[ ]를 사용하여 데이터를 감쌉니다.엑셀처럼 표 데이터를 다룹니다. 필터링, 합치기, 요약 통계량 산출의 지존입니다.
import pandas as pd
수치 계산의 기초. 아주 거대한 행렬 연산을 광속으로 처리하는 수학 엔진입니다.
import numpy as np
데이터 시각화의 조상님. 모든 차트와 그래프의 뼈대를 만드는 도구입니다.
import matplotlib.pyplot as plt
과거에는 논문 100편을 읽는 데 수개월이 걸렸으나, 현재는 LLM을 통해 주제별 핵심 쟁점(Topic modeling)을 하루 만에 요약할 수 있습니다.
"이 연구 질문에 대해 지난 5년간 가장 큰 반론을 제기한 논문 3편을 찾아 핵심 주장을 요약해줘."
* 주의: AI가 생성한 인용구는 반드시 원본 논문과 대조하여 교차 검증해야 합니다.
'정치적 혐오'라는 추상적 개념을 측정하기 위한 설문 문항을 설계하거나, 분석 가설의 논리적 결함을 찾을 때 AI를 활용합니다.
파이썬의 문법을 모두 외울 필요는 없습니다. 내가 하려는 분석의 '논리'를 설명하면 AI가 '코드'로 번역해줍니다.
우리는 이제 '구문(Syntax)' 전문가가 아니라 '설계(Design)' 전문가가 되어야 합니다.
데이터 뒤에는 '사람'이 있습니다. 인간을 대상으로 하는 연구를 할 때는 반드시 기관생명윤리위원회(IRB)의 사전 승인을 받아야 합니다.
"데이터는 차갑게 다루되, 그 주체인 인간은 따뜻하게 존중하십시오."
파이썬 기초, 기술통계, 설문 설계, 가설 검정의 첫걸음.
회귀분석의 정석, 인과추론 전략, 통제 변수의 미학.
텍스트 마이닝, LLM 혁명, 웹 데이터 수집, 그리고 파이널 프로젝트.
본격적인 데이터 핸들링: Pandas 라이브러리를 활용한 데이터 정리 및 실전 기술통계 분석 (중심성과 변동성).
개인 구글 계정 준비 및 '나만의 첫 번째 코랩 노트북' 생성 완료해오기.
여러분이 이번 학기 가장 '데이터로 검증해보고 싶은' 사회과학적 의문은 무엇인가요?