정치학방법론

Week 09. 질적 분석 방법론 (Qualitative Analysis Methods)

제9주차. 질적 분석 방법론의 이해와 코딩

숫자가 담지 못하는 의미의 재구성

학습의 목적

통계와 수식이 포착할 수 없는 인간의 주관성, 사회적 맥락, 권력의 미세한 작동 방식을 어떻게 과학적으로 밝혀낼 수 있을지 탐구합니다.

비정형 데이터의 세계

인터뷰, 연설문, 정책 문서, 현장 관찰 기록 등 정형화되지 않은 텍스트 속에서 어떻게 일관된 '패턴'과 '이론'을 발견하는지 배웁니다.

우리가 숫자로만 정치를 이해하려 할 때 필연적으로 놓치게 되는 정치의 '본질'은 무엇일까요?

주차 목차

Table of Contents

이번 주 학습 흐름

  • Part 1. 질적 연구의 철학적 기반: 실증주의의 한계와 해석학적 접근
  • Part 2. 근거 이론 (Grounded Theory): 현장에서 이론을 길어 올리는 법
  • Part 3. 텍스트 데이터의 코딩(Coding): 데이터를 쪼개고 라벨링하기
  • Part 4. 개방/축/선택 코딩의 실제: 추상화의 사다리 오르기
  • Part 5. 코딩북(Codebook) 작성: 주관성을 통제하는 신뢰성의 도구
  • Part 6. 인간 vs 기계: 전통적 코딩과 LLM 제로샷 라벨링의 비교
"연구자의 주관이 개입된다"는 사실이 과연 질적 연구의 약점일까요, 아니면 현상을 깊이 있게 해석하기 위한 필수적 도구일까요?

양적 연구와 질적 연구

Variables vs Meanings

무엇을(질문) 어떻게(방법) 바라볼 것인가?

양적 연구 (Quantitative)

수많은 표본을 바탕으로 변수들 사이의 관계를 보편적인 법칙으로 증명하고자 합니다. "How Many?"나 상관성에 초점을 둡니다.

"민주주의 국가에서 시위가 발생할 확률은 권위주의 국가보다 20% 높다."

질적 연구 (Qualitative)

소수의 사례를 통해 특정한 사건이 발생하는 '메커니즘'과 사람들의 '내면적 동기'를 추적합니다. "How?" 또는 "Why?"를 묻습니다.

"광장에 나온 시위대는 국가폭력을 경험하며 어떻게 스스로의 정체성을 재규정하는가?"
'민주화 현상'을 연구할 때 100개국의 통계 패널 데이터와 한 국가의 심층 인터뷰 중 무엇이 더 우월한 진리를 제공한다고 할 수 있을까요?

해석학의 전통

Hermeneutics in Politics

맥락이 없으면 데이터는 '죽은 텍스트'다

인간의 사회적 행위는 자연 현상과 달리, 그 행동을 하는 행위자 스스로가 부여하는 의미(Meaning)를 갖습니다.

Geertz의 '두꺼운 묘사 (Thick Description)'

눈을 깜빡이는 행위(생물학적 사실)가 '윙크(사회적 신호)'가 되려면 그 문화적 맥락이 해석되어야 합니다. 질적 연구자는 단순한 현상이 아닌 그 '윙크'의 의미를 파악합니다.

정치인의 투표 행위를 분석할 때, 찬성/반대라는 결과값(숫자) 너머에 있는 당내 역학관계나 지역구의 압력을 어떻게 코딩할 수 있을까요?

방법론적 가정

Ontology & Epistemology

우리가 진리를 알아내는 방법의 차이

연역적 접근 (Deduction) - 양적 연구

기존의 이론에서 출발하여 가설을 세우고, 데이터를 수집하여 이 이론이 맞는지 '검증'합니다.

  • 방향: 이론 → 가설 → 관찰 → 확인

귀납적 접근 (Induction) - 질적 연구

텅 빈 도화지에서 시작합니다. 현장에서 데이터를 모으고, 그 데이터 속에서 점진적으로 규칙을 찾아내어 궁극적으로 '이론'을 구성합니다.

  • 방향: 관찰 → 패턴 발견 → 임시 가설 → 이론 구성
처음부터 아무런 이론적 편견(백지상태) 없이 현장에 들어가서 데이터를 수집한다는 것은 현실적으로 가능한 일일까요?

질적 데이터의 종류론

Types of Qualitative Data

세상의 모든 흔적이 데이터가 된다

  • 심층 인터뷰 (In-depth Interviews): 당사자의 입을 통해 듣는 내밀한 동기.
  • 참여 관찰 (Participant Observation): 연구자가 현장에 직접 뛰어들어 생활하며 기록하는 에스노그래피.
  • 문서 기록 (Documentary Records): 회의록, 기밀 해제 문서, 법안, 판결문 등 제도의 궤적.
  • 시각 자료: 시위 현장의 사진, 포스터, 선거 광고의 미장센 등.

'비정형'이라는 도전

이 자료들은 스프레드시트에 깔끔하게 들어가지 않습니다. 무수히 긴 텍스트와 파편화된 기록 속에서 연구자는 스스로 체계를 창조해야 합니다.

인터뷰이가 기억을 왜곡하거나 연구자에게 잘 보이기 위해 거짓말을 한다면, 우리는 그 인터뷰 데이터를 어떻게 과학적으로 신뢰할 수 있을까요?

질적 연구의 논리 구조

Iterative Process

선형적이지 않은 나선형의 분석 과정

데이터 수집과 분석이 분리되지 않습니다. 자료를 모으면서 동시에 분석하고, 분석하다가 구멍이 보이면 다시 현장으로 나갑니다.

수집 코딩 패턴 발견 이론 구체화 / 질문 수정
이론적 포화 (Theoretical Saturation)
연구는 언제 끝나는가? "더 이상 새로운 정보나 범주가 도출되지 않을 때"를 우리는 어떻게 객관적으로 증명할 수 있을까요?

이론적 포화

Theoretical Saturation

"더 이상 새로울 것이 없다"는 확신

질적 연구의 '표본 크기' 기준

양적 연구는 통계적 유의성을 위해 N이 커야 하지만, 질적 연구는 10명을 인터뷰하든 50명을 인터뷰하든 '패턴이 반복되는 순간'이 중요합니다.

새로운 인터뷰이를 만나도 우리가 이미 만든 범주나 분석 틀 안에서 그들의 이야기가 온전히 설명될 때, 우리는 '포화' 상태에 도달했다고 선언합니다.

우리가 '새로운 정보가 없다'고 느끼는 것이 사실은 연구자의 시야가 좁아져서 새로운 것을 보지 못하는 편향 때문은 아닐까요?

근거 이론

Grounded Theory

경험적 관찰 데이터에 기반한 귀납적 이론 도출

Grounded Theory (Glaser & Strauss, 1967): 거대 담론이나 선험적 이론에 현실을 끼워 맞추는 것에 반발하며 등장한 사회과학의 혁명입니다.

핵심 철학

  • 이론은 하늘에서 떨어지지 않는다; 철저히 데이터에 '근거하여(grounded)' 발현되어야 한다.
  • 선입견 배제: 문헌 연구를 너무 깊게 하는 것조차 초반에는 피하라고 권장합니다(시야가 좁아지므로).
기존 이론(문헌)을 전혀 모른 채 무작정 현장의 데이터만 본다면, 연구자는 과연 사회과학적으로 의미 있는 질문을 던질 수 있을까요?

지속적 비교법

Constant Comparative Method

근거 이론의 핵심 구조

데이터의 한 조각과 다른 조각을 끊임없이 비교하며 공통점과 차이점을 찾아내는 행위입니다.

  • 사례 vs 사례 비교
  • 개념 vs 데이터 비교
  • 이론 구조 vs 신규 관찰 비교
비유: 수천 조각의 퍼즐을 맞출 때, 전체 그림을 모르는 상태에서 색깔과 모양이 비슷한 조각들끼리 묶어가며 거대한 형태를 유추해내는 과정과 동일합니다.
비슷해 보이는 데이터라도 맥락에 따라 전혀 다른 의미를 지닐 수 있다면, 우리는 이 '유사함'을 어떤 기준으로 판단해야 할까요?

질적 데이터 분석의 3단계

Grounded Theory Coding

흩어진 말들을 이론 건축물로 조립하기

1. 개방 코딩 Open Coding 데이터 해체 2. 축 코딩 Axial Coding 범주망 구축 3. 선택 코딩 Selective Coding 핵심 이론 통합
데이터를 갈기갈기 찢는 '해체(개방)'와 다시 모으는 '조립(축/선택)' 과정이 과학적 글쓰기에서 왜 반드시 필요할까요?

개방 코딩

Open Coding

원시 데이터를 잘게 쪼개어 라벨 붙이기

현상의 해체

문장 단위, 때로는 단어 단위로 텍스트를 읽으며 그 안에 담긴 '의미'를 포착해 짧은 이름표(Concept)를 붙이는 작업입니다.

"우리 부서는 아무리 좋은 아이디어를 내도 윗선에서 예산 없다고 다 잘라버리니까, 다들 그냥 시키는 일만 하는 거죠."

→ 도출된 개념(Concepts):
#상부_의사결정_통제
#자원(예산)_부족
#무력감_학습
#수동적_업무태도
수천 개의 개념(라벨)이 쏟아져 나올 텐데, 연구자는 이 혼돈의 상태를 어떻게 이겨내야 할까요?

개념에서 범주로

From Concepts to Categories

파편화된 개념들을 추상화의 바구니에 담기

개방 코딩으로 만들어진 수많은 개념(라벨)들의 공통 속성을 묶어, 한 단계 더 높은 추상적 이름비(Category)를 짓습니다.

하위 개념 (개방 코딩):
  • 결재 지연
  • 상사의 무시
  • 성과 보상 부재
상위 범주 (구조화):

"조직 내 구조적 체념"

하위 개념들을 어떤 논리로 묶느냐에 따라 연구의 결과가 완전히 달라질 수밖에 없습니다. 연구자의 이 거대한 자의성을 어떻게 통제하죠?

축 코딩

Axial Coding

패러다임 모형: 원인과 결과의 뼈대 세우기

이제 범주(Category)들이 서로 어떤 관계를 맺고 있는지 논리적 축(Axis)을 중심으로 연결합니다. 정적인 개념들이 동적인 이론이 됩니다.

Strauss & Corbin의 패러다임 모형

인과적 조건 → [중심 현상] → 작용/상호작용 전략 → 결과

(여기에 맥락적/중재적 조건 개입)

질적 연구가 양적 연구의 통계적 인과관계(회귀분석)와 다른 점은, 인과 도식이 '확률적'이 아니라 행위자의 '맥락적' 전략을 거친다는 점입니다. 왜 그럴까요?

축 코딩의 구조화 예시

Example of Axial Coding

사례: 권위주의 국가 공무원의 복지부동

  • 인과적 조건: 불투명한 하향식 의사결정 구조
  • 중심 현상: 정치적 리스크에 대한 극한의 공포
  • 맥락적 조건: 내부 고발자에 대한 보호법 부재
  • 중재적 조건: 강력한 사정기관의 감시 시스템
  • 작용/상호작용 전략: 문서 파기, 책임 떠넘기기, 지연 결재(복지부동)
  • 결과: 행정 시스템의 마비 및 정책 실패의 만성화
이 도식을 통해 우리는 "공무원들이 게을러서 일하지 않는다"는 표면적 이유 너머에 어떤 권력의 역학이 숨어있음을 주장할 수 있나요?

선택 코딩

Selective Coding

단 하나의 텍스트, '핵심 범주'의 탄생

이야기 개요 (Storyline)

축 코딩으로 묶인 여러 뼈대 중에서, 연구 전체를 단 하나의 문장이나 개념으로 관통하는 '핵심 범주(Core Category)'를 선택합니다.

모든 범주가 이 '핵심 범주'를 중심으로 통합되어 최종적인 '이론(Theory)'으로 정립됩니다. 논문의 제목이나 결론이 되는 단계입니다.

핵심 범주: "생존을 위한 제도적 은폐 전략"
단 하나의 핵심 이야기로 수십 명의 복잡한 인터뷰를 환원하는 과정에서 놓치거나 소외되는 '소수의 목소리'는 어떻게 처리해야 합니까?

코딩의 도구들

Software for Qualitative Research

포스트잇에서 CAQDAS로의 진화

전통적 방식

수백 장의 전지에 인터뷰 대본을 인쇄하고 형광펜을 칠하며 가위로 잘라 포스트잇처럼 모으는 '방바닥 코딩'. 신체적, 직관적 감각을 극대화합니다.

CAQDAS

(Computer-Assisted Qualitative Data Analysis Software)

  • NVivo, MAXQDA, ATLAS.ti 등
  • 텍스트 하이라이팅, 코드 관계망 형성, 빈도 매트릭스 도출 등 복잡한 데이터 관리 자동화
소프트웨어가 질적 자료의 '관리'는 편하게 해주지만, 연구자의 뇌에서 통찰이 일어나는 '사고 과정'까지 대체할 수 있을까요?

주관성의 방어막: 코딩북

Codebook

나의 코딩이 남의 눈에도 타당하도록 만드는 설계도

질적 연구의 가장 큰 약점은 "다른 연구자가 해도 똑같은 결과가 나올까?"입니다. 코딩북(Codebook)은 각각의 코드(개념)가 무엇을 의미하는지 엄격하게 규정한 '사전'입니다.

[코드명]: 책임 떠넘기기 (Blame Shifting)

[정의]: 행위자가 정책 실패나 부정적 결과에 대한 책임을 타 부서나 상급자에게 전가하는 언어적 방어 행위.

[포함 조건]: "내 소관이 아니다", "위에서 시켰다" 등의 발언.
[배제 조건]: 단순히 시스템의 한계를 지적하는 철학적 비판은 포함하지 않음.
법전에 명확한 살인죄의 정의가 있어도 판사마다 우발성/고의성 판단이 다르듯, 완벽한 코딩북이 있어도 연구자 간의 불일치는 왜 발생할까요?

연구자 간 신뢰도

Inter-coder Reliability

우리는 얼마나 의견이 일치하는가?

교차 코딩 (Cross-coding)

한 사람의 주관을 통제하기 위해, 2인 이상의 연구자가 동일한 코딩북을 바탕으로 같은 텍스트를 독립적으로 코딩해봅니다.

신뢰도 측정 지표

  • 단순 일치도 (%): 전체 데이터 중 두 코더가 일치한 비율
  • Cohen's Kappa ($\kappa$): 우연히 일치할 확률을 수학적으로 걸러낸 더 엄격한 신뢰도 지표. (보통 0.7 이상이면 우수)
두 연구자의 코딩이 불일치했을 때, 통계적으로 점수만 낮추고 끝낼 것이 아니라 이 불일치(충돌) 지점을 어떻게 심층 논의의 기회로 삼을 수 있나요?

거시에서 미시로의 이행

Macro to Micro

질적 연구가 그리는 정치학의 해상도

투표율, GDP 증가, 군사비 지출 등 거시적 구조 변수만으로는 "그 변화를 일으킨 살아 숨 쉬는 행위자"를 보지 못합니다.

질적 연구는 거시 지표 사이의 '블랙박스'를 열고 들어가, 개인의 감정, 오해, 전략적 타협, 부조리 등을 정치학의 핵심 변수로 끌어올립니다.

구조주의적 맑스주의가 설명하지 못했던 민중의 일상적 저항의 미시적 기제를, 질적 연구는 어떻게 포착해냈을까요? (일축, 늑장 부리기 등 '약자의 무기')

인간 vs 기계: LLM의 충격

AI & Qualitative Research

통찰하는 인간, 추론하는 기계

인간 연구자가 수개월간 텍스트와 씨름하며 체화하던 코딩의 과정을, 이제 LLM(대규모 언어 모델)이 순식간에 대체할 수 있는 시대가 되었습니다.

제로샷 라벨링 (Zero-shot Labelling)

별도의 사전 학습 단계 없이(Zero-shot), 수만 건의 텍스트 원문에 프롬프트를 입력하여 즉각적으로 범주와 코드를 박아넣게 만드는 기법입니다.

*주의: 이 기술적 구현 원리와 툴은 11주~12주차에서 집중적으로 다룹니다. 본 주차에서는 인간의 '직관'과의 방법론적 비교에만 초점을 맞춥니다.
LLM이 1만 건의 인터뷰를 10분 만에 코딩했다면, 우리는 이 결과를 연구적 통찰로 보아야 합니까, 아니면 단순한 확률적 텍스트 생성으로 보아야 합니까?

전통적 코딩과의 비교

Human Intuition vs AI Inference

우리는 무엇을 잃고 무엇을 얻는가?

전통적 수작업 딥 코딩

  • 장점: 행간의 의미, 비꼬는 뉘앙스, 한숨의 의미 등 고맥락적 이해.
  • 단점: 처리 시간의 한계(Scale 문제), 데이터 과부하 시 연구자의 인지적 소진.

LLM 기반 코딩

  • 장점: 방대한 자료의 초고속 분류, 인간의 일관성 및 편향 문제 완화.
  • 단점: "왜 그렇게 분류했는가?"에 대한 설명의 한계(환각), 맥락을 놓친 기계적 패턴 매칭.
인간이 텍스트를 읽으며 느끼는 끈적한 '오감'과 '분노' 같은 인지 과정이 거세된 LLM의 코딩은, 사회과학의 해석적 전통을 파괴하는 행위일까요?

방법론적 타협

Hybrid Epistemology

AI를 코더가 아닌 '협력적 비판자'로

LLM에게 전권을 위임하는 것은 위험합니다. 대신 연구자의 초기 개방 코딩 내용과 LLM이 도출한 코딩의 차이결과(Mismatch)를 관찰합니다.

생산적 오독

AI가 엉뚱하게 코드 분류를 한 지점이 오히려 인간 연구자가 무의식적으로 가진 선입견(사각지대)이나 이론적 빈틈을 보여주는 계기가 될 수 있습니다.

AI 모델마다 정치적 편향(예: 진보적/보수적 응답)이 존재한다면, AI 보조 코딩은 연구를 더 중립적으로 만들까요, 아니면 편향을 알고리즘으로 세탁할 뿐일까요?

객관성에 대한 강박 넘어서기

Reflexivity

반성성: 연구자 자신이 가장 강력한 도구다

질적 연구의 역설

우리는 관찰자의 카메라를 숨길 수 없습니다. 백인 남성 연구자와 흑인 여성 연구자가 빈민가에서 얻어내는 인터뷰 내용은 다를 수밖에 없습니다.

연구자 자신의 위치 노출

질적 연구는 완벽한 객관성(환상)을 추구하지 않습니다. 대신 연구자는 자신의 계급성, 성별, 편견이 연구에 어떻게 영향을 주었는지 논문에 솔직하게 기록(반성성)합니다.

"연구 자체가 투명해지는 것"과 "데이터 자체의 완벽한 객관성" 중, 정치학 방법론에서 진정으로 과학적 태도는 무엇입니까?

다각화 (Triangulation)

Methodological Triangulation

하나의 현상을 포위하여 타당성 확보하기

데이터 하나, 사람 하나의 말만 믿을 수 없습니다. 다각화(삼각측량법)는 진실을 교차 검증하는 질적 연구의 강력한 무기입니다.

  • 자료의 다각화: 인터뷰 + 내부분서 + 현장 관찰을 동시에.
  • 연구자의 다각화: 여러 명의 코더 참여.
  • 이론의 다각화: 동일한 현상을 맑스주의적 관점과 합리적 선택 관점에서 교차 적용해보기.
다양한 자료가 모였는데도 지목하는 방향이 모두 다르다면, 우리는 어느 것을 진실로 채택해야 할까요?

맥락적 일반화

Transferability

질적 연구의 결과는 다른 지역에도 적용되는가?

통계적 일반화의 포기

질적 연구는 N이 작기 때문에 "모든 인간은 이러하다"라고 확률적으로 주장할 수 없습니다. (이것은 양적 연구의 역할 영역입니다.)

이론적 전이성 (Transferability)

대신 매우 상세한 맥락적 조건(두꺼운 묘사)을 제공하여, 독자(다른 연구자)가 "이 상황과 유사한 B지역에서도 이 메커니즘이 작동하겠군"이라고 유추하게 만듭니다.

"1명의 삶을 깊게 파고들어 인류 보편의 슬픔을 그려내는 문학"과 질적 연구의 '일반화'는 어떤 점이 닮아있고 어떤 점이 다른가요?

현장 연구의 윤리

Research Ethics in Fieldwork

데이터 뒤에 사람이 숨 쉬고 있다

상처를 들춰내는 행위

국가폭력 피해자, 권력자 비리 고발자 등을 인터뷰할 때, 연구를 명목으로 그들에게 다시 트라우마를 유발하거나 법적 위험을 초래할 수 있습니다.

  • 고지된 동의 (Informed Consent)
  • 익명화(Anonymization) 및 데이터 보안
  • 연구자와 대상 권력 관계의 성찰
정치 비리를 고발하는 중요한 인터뷰 자료가 수집되었으나 응답자의 신분 노출이 예견될 때, 학문적 진보와 개인의 안전 중 연구자는 무엇을 택해야 합니까?

질적 방법론의 글쓰기

Writing as Analysis

"글을 쓰는 과정 자체가 분석이다"

수식이나 표 하나로 결과를 요약할 수 있는 양적 논문과 달리, 질적 논문은 언어라는 매개체를 통해 독자를 설득하는 수사학적(Rhetorical) 과정을 동반합니다.

생생한 인용구(Quotes)를 전략적으로 배치하여 현장감을 부여하고, 이를 다시 추상적 이론으로 끌어올리는 서사적 리듬감이 필수적입니다.

Memo-writing: 코딩 중간중간 연구자의 직관과 이론적 영감을 적어둔 메모들이 집필 과정의 핵심 재료가 됩니다.
문장력이 빈약한 질적 연구자는 뛰어난 코딩을 수행했더라도 좋은 학자가 될 수 없을까요?

정치학에서의 모범 사례

Classic Works

우리가 잃지 말아야 할 학문적 거장들

James Scott - 무기의 발명 (Weapons of the Weak)

동남아시아 촌락에 수년간 거주하며, 농민들이 공식적 반란이 아닌 꾀병, 거짓말, 험담 등 일상적 저항의 방식으로 지주계급의 착취를 어떻게 피하는지 관찰했습니다.

가치

통계청 데이터만 보았다면 이 마을 농민들은 '조용하고 순종적인 계급'으로 코딩되었을 것입니다. 질적 연구가 정치권력 분석의 맹점을 폭로한 위대한 사례입니다.

컴퓨터 알고리즘이 아무리 발전하더라도, 제임스 스콧과 같은 장기 인류학적 현장 연구의 가치가 사라지지 않을 이유는 무엇일까요?

주차 요약

Summary

거대한 숫자 뒤에 가려진 의미의 옹호자들

  • 질적 연구의 사명: 인간 행위의 복잡성과 맥락, 동기를 두껍게 묘사하는 것입니다.
  • 근거 이론과 코딩: 데이터 그 자체에서 발원하여, 해체(개방 코딩)와 재조립(축 코딩), 통합(선택 코딩)을 통해 이론의 건축물을 짓습니다.
  • 인간과 기계 사이: 신뢰도 높은 코딩북 개발과 질적 반성성은 여전히 인간 고유의 영역이며, LLM은 이를 위한 강력한 '비교/검증 도구'로 제한되어야 합니다.
  • 최종 결론: 정치학자는 가장 객관적인 척 하는 숫자의 폭력에서 벗어나, 때로는 비정형화된 주관의 숲으로 기꺼이 들어가야 합니다.
"세상에서 가장 가치 있는 일들 중 상당수는 정확하게 계산될 수 없는 것들이다."
1 / 30