Quantitative Analysis

VOL. CCXXV ... No. 59,101
Week 01

Research Foundations & Cloud Computing

By Kim Chan Woo · Political Science Data Lab

Perspective

Special Report

Beyond Intuition: The Power of Evidence

사회과학의 고전적인 질문들은 오랫동안 직관과 철학의 영역에 머물러 있었습니다. "사람들은 왜 보수화되는가?", "정치적 갈등은 어떻게 해결되는가?" 등의 질문에 대해 과거의 학자들은 거대 담론으로 답하곤 했습니다.

하지만 오늘날 우리는 이 질문들에 대해 숫자와 증거로 대답할 수 있는 시대를 살고 있습니다. 계량분석은 단순히 통계를 계산하는 행위가 아니라, 복잡하게 얽힌 사회 현상을 객관적인 관찰 단위로 해체하고 재구성하여 '보편적 진실'에 다가가는 과정입니다.

The "Evidence" Turn

직관(Intuition)에서 증거(Evidence)로의 전환은 사회과학의 권위를 높이고 실질적인 정책 대안을 제시하는 핵심 엔진이 되었습니다. 우리는 이번 학기, 그 엔진의 설계도를 배우게 됩니다.

Mission

Why Quantitative?

The Three Pillars of Quantification

Objectivity

연구자의 개인적 편향(Bias)이나 가치관을 배제하고, 누가 분석하더라도 동일한 데이터에서 동일한 결과가 도출될 수 있는 '상호 주관적 검증 가능성'을 확보합니다.

Scale

단편적인 사례(Anecdote)를 넘어 수천 명, 수만 명의 대규모 데이터를 조망함으로써 사회 전체의 거시적인 흐름과 패턴을 한눈에 파악할 수 있는 시야를 제공합니다.

Precision

"많다", "적다"는 모호한 표현 대신 "비율이 \( 15\% \) 증가했다"는 정밀한 수치로 현상을 기술하여 논의의 명확성을 비약적으로 높입니다.

Crisis Check

The Bias Trap

Escape from "Common Sense"

THE MYTH

"MZ세대는 정치에 무관심할 것이다"

이것은 표면적인 언론 보도와 개인적인 경험, 혹은 세대 간의 고정관념에 기반한 '일반화의 오류'일 가능성이 매우 높습니다.

THE DATA

Empirical Investigation

연령대별 투표율과 이슈별 반응 속도를 시계열 데이터로 분석하면, 단순히 무관심한 것이 아니라 '효능감'에 기초한 매우 전략적이고 역동적인 참여 패턴이 발견됩니다.

Definition

Conceptual Framework

What is Quantitative Analysis?

"사회 현상을 수치화된 데이터(Numerical Data)를 기반으로 분석하고, 통계적 방법을 활용하여 가설을 검증하는 체계적 과정."

  • Measurement: '민주주의'나 '갈등' 같은 추상적 개념을 측정 가능한 지표(Index)로 변환하는 '조작화'가 필수적입니다.
  • Generalization: 관찰된 소수의 표본(Sample)을 통해 우리가 알지 못하는 모집단(Population)의 특성을 과학적으로 추설(Inference)합니다.
  • Reproducibility: 나의 분석 과정을 코드와 매뉴얼로 투명하게 공개하여, 누구나 나의 결과에 도전하거나 재확인할 수 있도록 합니다.

Pillars

Scientific Missions

The Four Missions of Research

1. Description (기술)

현재 상태를 왜곡 없이 그대로 보여주는 것입니다. 지지율의 분포나 불평등 지수(\( Gini \))의 높낮이를 정확한 수치로 기술합니다.

2. Explanation (설명)

'왜' 그런 현상이 일어났는지 원인과 결과의 관계를 규명합니다. 예컨대 경제 성장이 민주화에 미치는 영향을 통계적으로 검증합니다.

3. Prediction (예측)

축적된 과거 데이터를 모델링하여 미래의 정치적 행태를 추정합니다. 선거 결과 예측 모델이나 갈등 지수 전망이 이에 해당합니다.

4. Evaluation (평가)

특정 정책이나 제도가 도입된 후, 그 목표를 달성했는지 혹은 부작용은 없는지 데이터를 통해 엄밀하게 평가합니다.

Analogy

Culinary Arts

Data Science is Like Cooking

훌륭한 요리사가 되기 위해서는 도구 사용법과 재료의 특성을 모두 알아야 합니다.

  • Ingredients (데이터): 신선한 재료가 맛의 절반을 결정하듯, 신뢰할 수 있는 데이터가 분석의 품질을 결정합니다.
  • Prep (전처리): 흙을 털어내고 재료를 다듬듯, 결측치를 처리하고 오타를 수정하는 과정이 전체 작업의 \( 70\% \)를 차지합니다.
  • Cooking (분석): 레시피(회귀분석, 딥러닝)에 따라 재료를 조리하여 최종 결과물을 만들어냅니다.

GIGO Principle

Garbage In, Garbage Out

아무리 화려한 통계 기법(조리법)을 써도, 기초 데이터(재료)가 오염되어 있다면 그 결과물은 독이 될 뿐입니다.

Inquiry

Political Economy

Example 1: Income vs Ideology

The Research Puzzle

"소득 수준이 높아지면 인간은 정말 더 보수적으로 변하는가?"

  • Theoretical Hypothesis: 가계 소득이 증가할수록 세금 감면과 시장 자유를 지지하는 보수 정당 지지도가 상승할 것이다.
  • Complexity: 데이터 분석 결과, 연령대가 낮을수록 소득 증가가 이념 변화에 미치는 영향이 미미하거나 오히려 반대인 '상호작용 효과'가 발견되기도 합니다.
  • The Goal: 우리는 단순한 상관관계(\( Correlation \))를 넘어, 다른 변수들을 통제한 상태에서의 순수한 영향력을 측정합니다.

Inquiry

Digital Transformation

Example 2: SNS & Participation

The Digital Puzzle

"소셜 미디어는 민주주의를 활성화하는가, 아니면 양극화하는가?"

  • Data: 트위터(X)의 실시간 API 데이터와 설문조사 패널 데이터를 매칭하여 행동의 변화를 추적합니다.
  • Discovery: 정보 도달 범위는 넓어졌으나, 자신이 보고 싶은 것만 보는 '필터 버블(\( Filter\ Bubble \))' 현상으로 인해 극단 지지층의 참여만 과도하게 가시화되는 패턴이 발견됩니다.
  • Conclusion: 기술의 도입이 반드시 질적인 참여의 향상으로 이어지지는 않는다는 비판적 통찰을 데이터로 증명합니다.

Ontology

Types of Information

Structured vs Unstructured Data

Type A: Structured

엑셀이나 데이터베이스처럼 행(Row)과 열(Column)로 딱딱 맞춰진 데이터입니다. 나이, 지지 정당, 소득 수준 등 수치화가 끝난 상태입니다.

Type B: Unstructured

정치인의 연설문, 뉴스 본문, 시위 현장의 이미지 등 일정한 형식이 없는 데이터입니다. 과거에는 분석이 어려웠으나 현재는 AI의 주요 먹잇감이 됩니다.

The Frontier: 최근 정치학의 혁신은 '비구조화 데이터'를 어떻게 '구조화 데이터'로 정교하게 변환(Embedding)하느냐에 달려 있습니다.

Epistemology

Research Paradigm

The Positivist Lens

양적 연구는 관찰 가능한 사회적 사실을 객관적으로 측정하고, 현상들 사이의 일반적인 법칙(Law-like regularities)을 발견하려 합니다.

  • Deductive (연역적): 확고한 이론에서 출발하여 가설을 세우고, 실제 데이터를 통해 그 가설이 '맞는지 틀린지' 시험합니다.
  • Generalization: 특수한 개인의 경험보다는, 수많은 사례를 관통하는 보편적인 사회적 경향성을 도출하는 데 주력합니다.
  • Objectivity: 분석 과정을 수학적 모형(\( Model \))으로 정형화하여, 연구자의 주관적 판단이 개입할 여지를 최소화합니다.

History

The Behavioral Revolution

Institutionalism to Behavioralism

Traditional Institutionalism

과거의 정치학은 법률, 헌법 조항, 정부 기구의 배치 등 '공식적 제도'의 구조를 묘사하는 데 집중했습니다.

Behavioralism (행태주의)

1950년대 이후, 제도 자체가 아니라 그 안에서 일어나는 '사람들의 행동'에 주목하기 시작했습니다. "투표라는 행위 뒤에는 어떤 심리적 자극과 사회적 배경이 있는가?"를 측정하면서 현대 계량분석이 탄생했습니다.

Scientific Shift

이 혁명 이후 정치학은 서술적(Descriptive) 학문에서 실증적(Empirical) 과학으로 한 단계 도약하게 됩니다.

Contrast

Qualitative Paradigm

The Deep Understanding

질적 연구는 현상의 내면에 숨겨진 의미와 맥락을 탐구하며, 숫자가 담지 못하는 인간의 동기를 추적합니다.

  • Inductive (귀납적): 풍부한 현장 사례를 통해 새로운 이론적 틀을 먼저 제시하고 나중에 검증의 길을 엽니다.
  • Contextual: 단순히 "투표했다/안했다"가 아니라, 그 지역 사회의 역사적 맥락과 심층 인터뷰를 통해 참여의 '질감'을 분석합니다.
  • Thick Description: 인류학자 기어츠(Geertz)의 용어처럼, 매우 구체적이고 밀도 있는 묘사를 통해 소수 사례의 깊이를 파고듭니다.

Integration

Mixed Methods

The Best of Both Worlds

EXPLORATORY DESIGN

먼저 심층 인터뷰(질적)를 통해 사람들이 정치 갈등을 느끼는 새로운 차원을 발견한 후, 이를 설문 문항으로 만들어 대규모(양적)로 검증합니다.

EXPLANATORY DESIGN

통계 분석(양적) 결과 도저히 이해되지 않는 이상치(Outlier)가 발견되었을 때, 해당 지역에 직접 가서 그 이유를 분석(질적)하여 보완합니다.

현대의 초일류 연구자들은 숫자와 언어, 두 가지 무기를 모두 자유자재로 다룹니다.

Workflow

The Scientific Cycle

The Six Steps of Analysis

1. Puzzle
연구 질문

📐

2. Theory
가설 설정

📥

3. Data
수집/전처리

📊

4. Model
통계 분석

💡

5. Interpretation
결론 도출

📢

6. Publication
학술적 소통

Technology

Language of Data

Why Python for Social Science?

  • Versatile: 통계 계산은 기본이고, 인터넷의 뉴스 데이터를 긁어오거나(Scraping) 딥러닝 모델을 돌리는 것까지 '한 소스'로 가능합니다.
  • Open Source: 전 세계 수백만 명의 연구자가 공유하는 오픈소스 도구(\( Pandas, Scikit-learn \)) 덕분에 누구나 최첨단 분석을 할 수 있습니다.
  • Modern Standard: 과거의 \( SPSS, STATA \)를 넘어 학계와 산업계가 소통하는 실질적인 표준 언어(\( Lingua\ Franca \))가 되었습니다.

Future-Proofing

파이썬을 익히는 것은 단순히 통계 도구를 배우는 것이 아니라, AI 시대의 논리적 사고력을 배양하는 것과 같습니다.

Infrastructure

Cloud Computing

Why Google Colab?

Zero Config

내 컴퓨터 성능에 구애받지 않습니다. 구글 클라우드 서버에서 Python을 돌리므로 브라우저만 있으면 즉시 시작할 수 있습니다.

In-Memory GPU

수백만 건의 텍스트를 처리하거나 인공신경망을 학습시킬 때 필요한 고사양 그래픽카드(GPU)를 구글이 무상으로 대여해줍니다.

Collaboration

분석 코드와 결과물을 구글 문서처럼 실시간으로 공유하고 공동 작업할 수 있어 팀 프로젝트에 최적화되어 있습니다.

Interface

Digital Workspace

The Anatomy of a Notebook

1. Text (Markdown) Cell

연구에 대한 설명, 제목, 주석을 적는 영역입니다. 글을 쓰듯 연구의 맥락과 가설을 기록합니다.

2. Code Cell

실제 Python 코드를 입력하고 실행하는 영역입니다. 왼쪽의 재생[▶] 버튼을 누르면 그 즉시 연산 결과가 아래에 출력됩니다.

"전통적인 '프로그래밍'과 '문서 작성'이 하나로 합쳐진 형태를 Jupyter Notebook이라고 부르며, Colab은 이를 클라우드화한 것입니다."

Efficiency

Flash Proficiency

Essential Colab Shortcuts

Execution Units

  • Shift + Enter: 셀 실행 후 다음 셀로 이동 (가장 많이 사용)
  • Ctrl + Enter: 현재 셀만 실행하고 머무름
  • Alt + Enter: 실행 후 아래에 새로운 비어있는 셀 추가

Structure (Ctrl+M + UI)

  • A / B: 현재 셀의 위(Above) 혹은 아래(Below)에 셀 추가
  • D: 현재 셀 삭제 (Delete)
  • Y / M: 코드(Code) / 텍스트(Markdown) 형식으로 즉시 전환

Persistence

Cloud Storage

The Cloud Connector

# 구글 드라이브 마운트 코드 from google.colab import drive drive.mount('/content/drive')

웹 브라우저에서 작업하지만, 내 소중한 데이터 파일은 구글 드라이브(Hard Drive)에 안전하게 보관됩니다.

  • 실습용 CSV 데이터셋을 클릭 한 번으로 불러오기 가능
  • 수 시간의 분석 끝에 얻은 결과물과 고해상도 차트를 자동 백업
  • 어느 컴퓨터에서 접속하든 동일한 연구 환경 재현

Axiom

The Atomic Units of Data

Python Primitive Types

# 변수에 데이터 할당하기 name = "Seoul" # String (문자열) population = 9500000 # Integer (정수) growth_rate = -0.05 # Float (실수) is_capital = True # Boolean (논리형)

Type Consistency

데이터 유형을 잘못 지정하면 연산 오류가 발생합니다. 예: 문자열 "100"과 숫자 100은 모양은 같지만 컴퓨터에게는 전혀 다른 존재입니다.

type(variable) 함수를 사용하여 데이터의 혈액형을 수시로 확인하는 습관을 들입시다.

Basics

Grouping Data

Lists: The Researcher's Pocket

단일 데이터가 아니라, 수많은 유권자의 이름이나 정당 리스트를 하나의 변수에 담아야 할 때 사용합니다.

  • 대괄호 [ ]를 사용하여 데이터를 감쌉니다.
  • Zero-Indexing: 프로그래밍에서는 순서가 1이 아니라 0부터 시작함을 명심하십시오.
# 정당 리스트 생성 parties = ["A-Party", "B-Party"] # 데이터 추가 parties.append("C-Party") # 두 번째(Index 1) 항목 접근 target = parties[1] # "B-Party"

Toolbox

Standard Packages

The Big Three Libraries

Pandas

엑셀처럼 표 데이터를 다룹니다. 필터링, 합치기, 요약 통계량 산출의 지존입니다.

import pandas as pd

NumPy

수치 계산의 기초. 아주 거대한 행렬 연산을 광속으로 처리하는 수학 엔진입니다.

import numpy as np

Matplotlib

데이터 시각화의 조상님. 모든 차트와 그래프의 뼈대를 만드는 도구입니다.

import matplotlib.pyplot as plt

Innovation

Augmented Intelligence

AI: From Reading to Analysis

STAGE 1: LITERATURE REVIEW

과거에는 논문 100편을 읽는 데 수개월이 걸렸으나, 현재는 LLM을 통해 주제별 핵심 쟁점(Topic modeling)을 하루 만에 요약할 수 있습니다.

Prompt as a Scalpel

"이 연구 질문에 대해 지난 5년간 가장 큰 반론을 제기한 논문 3편을 찾아 핵심 주장을 요약해줘."

* 주의: AI가 생성한 인용구는 반드시 원본 논문과 대조하여 교차 검증해야 합니다.

Innovation

Augmented Intelligence

AI: Operationalization Assistant

STAGE 2: RESEARCH DESIGN

'정치적 혐오'라는 추상적 개념을 측정하기 위한 설문 문항을 설계하거나, 분석 가설의 논리적 결함을 찾을 때 AI를 활용합니다.

# AI Prompt Example "온라인 뉴스 댓글의 혐오 표현을 측정하기 위한 '감정 사전'을 구축하려고 해. 보완해야 할 키워드 50개를 카테고리별로 추천해줘."

Innovation

Augmented Intelligence

AI: The Perfect Pair Programmer

Coding without Pain

파이썬의 문법을 모두 외울 필요는 없습니다. 내가 하려는 분석의 '논리'를 설명하면 AI가 '코드'로 번역해줍니다.

# User Request: "연령대별 투표율 CSV 파일을 읽어서, 2030 세대만 필터링한 뒤 막대 그래프로 그려줘." # AI Responses with functional Pandas/Seaborn code...

우리는 이제 '구문(Syntax)' 전문가가 아니라 '설계(Design)' 전문가가 되어야 합니다.

Ethics

Responsible Analytics

The Researcher's Duty: IRB

Human Subject Review

데이터 뒤에는 '사람'이 있습니다. 인간을 대상으로 하는 연구를 할 때는 반드시 기관생명윤리위원회(IRB)의 사전 승인을 받아야 합니다.

  • Anonymity: 피험자의 신원이 드러날 수 있는 정보는 철저히 가명화/익명화합니다.
  • Informed Consent: 연구의 목적과 위험성을 충분히 설명하고 자발적인 동의를 얻습니다.

The Golden Rule

"데이터는 차갑게 다루되, 그 주체인 인간은 따뜻하게 존중하십시오."

Roadmap

Current Progress

The 15-Week Journey

Part 1: Foundational (1-4)

파이썬 기초, 기술통계, 설문 설계, 가설 검정의 첫걸음.

Part 2: Core Models (5-7)

회귀분석의 정석, 인과추론 전략, 통제 변수의 미학.

Part 3: Innovation (9-14)

텍스트 마이닝, LLM 혁명, 웹 데이터 수집, 그리고 파이널 프로젝트.

Final Summary

Key Takeaways

What We Mastered in Week 01

  • Quantitative Logic: 숫자는 단순한 양이 아니라, 사회 과학적 질문에 대한 '정밀한 대답'입니다.
  • Infrastructure: Google Colab은 우리에게 무료 슈퍼컴퓨터를 제공하는 '디지털 연구소'입니다.
  • Augmentation: AI는 대체제가 아니라, 문헌 리뷰와 코딩을 돕는 '연구 비서'로 활용해야 합니다.
  • Responsibility: 데이터의 신뢰성과 연구 윤리(IRB)는 분석 기술보다 훨씬 앞서야 합니다.

Next Week

Preview

Cleaning the Chaos

Main Topic

본격적인 데이터 핸들링: Pandas 라이브러리를 활용한 데이터 정리 및 실전 기술통계 분석 (중심성과 변동성).

Mission

개인 구글 계정 준비 및 '나만의 첫 번째 코랩 노트북' 생성 완료해오기.

The Data Sea Awaits.

Closing

Q&A

Any Last Questions?

여러분이 이번 학기 가장 '데이터로 검증해보고 싶은' 사회과학적 의문은 무엇인가요?

Political Science Data Lab | 2026 Spring Semester
1 / 31