Week 14. Synthesis & Ethics (Integration of Methods)
제14주차. 방법론 통합 및 연구 윤리
방법론적 다원주의와 관찰자의 거울
우리는 무엇을 위해 데이터를 고문했는가
학습의 목적
한 학기 동안 배운 질적 연구, 인과 추론, 텍스트 마이닝, 기계 학습을 하나의 완성된 '정치학적 서사'로 융합하고, 이 과정에서 포기하지 말아야 할 치명적인 학숙적 가치를 돌아봅니다.
코스의 종착지
가장 훌륭한 방법론자는 망치를 쥔 사람이 아니라, 이 나사를 조일 때 망치를 버리고 가장 알맞은 드라이버를 꺼내 들 줄 아는 "태도의 소유자"입니다.
우리가 무장한 첨단 분석 기술들이 인간 정치의 더 나은 미래(해방)를 위한 것입니까, 아니면 단지 동료 학자들의 '심사 통과'를 위한 자기 과시 체계입니까?
조각난 렌즈들을 결합하기
- Part 1. 한 학기 대장정의 요약: 질적 도구에서 기계학습까지
- Part 2. 방법론적 다원주의(Pluralism): 혼합 연구의 필수성
- Part 3. 정량화의 폭력: 숫자는 어떻게 진실을 가리는가?
- Part 4. 알고리즘 차별과 AI 연구 윤리: 객관성의 신화 타파
- Part 5. 연구자의 스탠스: 권력에 대항하는 무기로서의 학문
- Part 6. 에필로그: 데이터의 시대를 넘어 지혜의 시대로
과연 통계적 엄밀성과 질적 깊이를 하나의 연구 안에서 동시에 100% 충족시키는 궁극의 '혼합 연구(Mixed Method)'라는 것이 물리적으로 존재할 수 있습니까?
우리가 구사해 온 무기 체계들
우리는 진리를 찾기 위해 계속해서 시력(Lens)을 바꿔 끼웠습니다.
- 질적 현장: 깊은 우물 속으로 내려가 인터뷰 대상자의 육성을 청취함. (두꺼운 묘사)
- 인과 추론: 통제된 실험실(DID, RDD)에서 X가 Y를 쏘았는지 범인을 색출함.
- 텍스트 마이닝: 10만 장의 연설문을 새의 눈(Bird-eye view)으로 훑어 지형을 읽음.
- 기계/AI 학습: 무수히 얽힌 블랙박스 속에서 내일의 결과를 예측하는 수정구슬을 구축함.
이 모든 무기를 쥐어보았습니다. 단 하나의 무기만 평생 써야 한다면 당신의 정치적 철학과 가장 맞닿아 있는 렌즈는 어느 것입니까?
학계에 만연한 오만과 편견
계량주의자의 오만
"수학적 증명(p-value)이 빠진 인터뷰 논문은 그저 연구자 개인의 소설이거나 일기장에 불과하다."
질적 연구자의 경멸
"숫자 놀음에 빠져 엑셀 파일만 들여다보느라, 피가 흐르고 눈물이 떨어지는 실제 정치 현실의 고통은 1%도 이해하지 못하는 박제된 학문이다."
진리는 이 두 극단의 맹목적 상호비방 사이에 얇게 떨어져 있습니다.
상호 보완해야 한다는 것을 모두가 머리로는 알면서도, 학계가 여전히 통계 방법론과 현장 기술 방법론으로 극단적 밥그릇 싸움을 하는 근본적 권력 구조는 무엇일까요?
퍼즐의 바깥쪽 테두리와 안쪽 그림 맞추기
우수한 연구는 양적 설계로 '가설의 보편성을 검증(일반화)'하고, 질적 설계로 '메커니즘의 틈새(설명력)'를 입체적으로 메우는 삼각 검증(Triangulation)을 시도합니다.
1단계: 시야의 확장 (양적 발견)
거대 포털 댓글 100만 개를 머신러닝으로 분석했더니, 뜻밖에도 "20대 여성층에서 안보 불안에 대한 분노가 특정 시기에 15% 이상 급증함"을 관측.
2단계: 동기 추적 (질적 잠수)
이 수치가 왜 발생했는지 기계는 대답하지 못합니다. 해당 변곡점 시기의 20대 여성 20명을 모아 FGI(초점 집단 면접)를 실시하여, 숨겨진 젠더적 공포의 메커니즘을 텍스트로 폭로합니다.
만약 두 방법론을 섞어서 동시 진행했는데 (통계로는 효과가 없다는데 인터뷰 대상자들은 효과가 엄청났다고 울부짖을 때), 당신은 어느 결과표(Result)를 학술지에 게재하겠습니까?
인간을 숫자로 쪼개어 버리는 칼질
무언가를 잰다는 것(Measure)은 필연적으로 어떤 풍부한 뉘앙스들을 잘라내 시궁창에 버려야만 한다는 뜻입니다.
범주화(Categorization)의 억압
설문지에서 "당신의 정치 성향은? 1.매우보수 ~ 5.매우진보"를 강제하는 순간, 특정 사안엔 보수적이고 특정 사안엔 진보적이며 그 경계에서 고뇌하는 '살아있는 인간성의 모순'은 영구 삭제됩니다.
정책 입안의 편리함을 위해서는 거칠게 범주화된 통계가 필수입니다. 국가의 효율성과 개인의 입체적 존엄 사이에서 데이터학자는 어느 쪽에 서야 합니까?
기계는 우리 사회의 차별을 복사기에 넣고 돌린다
과거의 낙관즘
초기 학자들은 인간 판사의 인종 편견을 제거하기 위해 차가운 AI 판사나 컴파스(COMPAS: 재범 예측 등 알고리즘)를 기용하면 완벽히 공정해질 것이라 믿었습니다.
가혹한 진실
알고리즘이 먹어 치운 과거 미국의 수십 년 치 사법 데이터 자체가 "백인에 관대하고 흑인에 가혹하게" 훈련된 인간 차별의 역사였습니다. 기계는 이를 수학적 패턴(진리)으로 인식하여 조직적 차별을 자동화해 냅니다.
흑인이 재범률이 높다는 과거 데이터의 '사실(Fact)'을 AI에게 고의로 지우고(Blinding) 학습시키는 것은 적극적인 차별 해소입니까, 아니면 데이터를 조작하는 연구 윤리 위반입니까?
"코드 한 줄 속에 이데올로기가 피를 흘리며 숨어 있다"
알고리즘은 자연 발생한 산맥과 계곡이 아닙니다. 백인/남성/고학력자 위주의 실리콘밸리 엔지니어 혹은 고소득 연구자의 무의식적 가치관이 코드 변수의 가중치(Weight)로 스며듭니다.
- 빈민가에 드론 감시를 늘리기 위해 코딩된 '치안 유지 최적화 함수'.
- 이 코드를 짠 사람은 단 한 번도 그 동네 주민과 치킨을 먹어본 적도 없고 그들의 경찰 공포증을 피부로 느껴본 적이 없는 계급입니다.
어떤 사회의 법은 선거를 통해 입법자를 바꿀 수 있습니다. 거대 테크 기업이 밀실에서 짠 알고리즘 법(통치 구조)에 대해 시민은 어떻게 '심판(투표)'할 수 있습니까?
타인의 고통을 크롤링하기
동의받지 않은 데이터 헐뜯기
인터넷 커뮤니티의 '우울증 갤러리'에 올라온 수천 개의 극절한 절망의 글들을 텍스트 마이닝을 위해 동의 없이 무단 스크래핑합니다.
학문적 착취
비식별화(ID 삭제) 조치를 했으니 합법이라고 변명하지만, 익명 세계에서 위로받고자 뱉어낸 타인의 내밀한 피와 눈물(Data)을 가공하여 연구자의 박사 학위(권력) 취득에 땔감으로 쓴다는 구조적 가해는 사라지지 않습니다.
"모든 공개된(Public) 데이터는 공공재의 연구 대상이다"라는 데이터 과학의 첫 번째 교리는, 인간 존엄 앞에 파기되어야 하는 낡은 구호입니까?
AI가 뼈대를 잡고 당신이 살을 붙인 논문의 주인
- 학계의 위선: 대부분의 연구자가 초록 번역, 코드 디버깅, 거친 문장 교정에 Claude나 ChatGPT를 쓰면서도 Acknowledgements(사사)에 이를 명시하지 않습니다.
- 본질적 질문: 만약 AI가 도출해 준 '문서 군집화(LDA)'의 특정 인사이트 하나가 내 논문의 결정적 가설이 되었다면, AI는 도구입니까 공동 저자입니까?
지도 교수가 한 줄도 쓰지 않고 아이디어만 주어 대학원생이 다 쓴 논문을 공동 저자로 등재하는 것은 허용하면서, 통찰을 던져준 AI는 왜 저자가 될 수 없습니까?
권력은 연구비(Grant)의 옷을 입고 다가온다
스폰서 편향 (Funding Bias)
정부 기관이나 특정 기업의 막대한 지원금을 받아 진행되는 대형 빅데이터 연구는, 통계적 유의성이 나오지 않거나 스폰서의 이해관계를 침해하는 결과를 무의식적으로 '서랍 속에 묻어버리는(File-drawer problem)' 경향이 짙습니다.
가난한 객관성
진정으로 예민하고 체제 전복적인 연구는 자본의 승인을 받지 못합니다. 방법론을 돌릴 막대한 클라우드 비용조차 감당 못 하는 주변부 학자들에게 '객관적 방법론'의 장벽은 너무나 높습니다.
자본 없이 거대 서버를 돌릴 수 없는 데이터 정치학에서, 우리는 맑스(Marx)가 대영박물관 도서관 구석에서 펜 하나로 자본주의를 전복했던 그 무서운 사상사적 파괴력을 기대할 수 있습니까?
학문은 무기력한 자들을 대변해야 한다
우리가 이렇게 복잡하고 험난한 방법론 수식과 파이썬 코드를 밤새워 익힌 이유는, 그것을 뽐내어 기득권의 스피커가 되기 위함이 아니어야 합니다.
대항 데이터 (Counter-Data) 생산
권력은 자신들에게 유리한 통계(예: 범죄율 감소, 고용률 증가)만 발표합니다.
우리가 단련한 스크래퍼(Spider)와 딥러닝 망을 은폐된 음지에 풀어, 국가가 세어주지 않는 노숙자의 동선, 플랫폼 노동자의 사망률, 숨겨진 혐오 발언을 발굴하여 숫자(무기)로 빚어내야 합니다.
연구자로서 당신은 "사회를 객관적으로 묘사하는 위성 카메라" 입니까, 아니면 "불평등을 조준하여 저격하는 스나이퍼" 입니까?
재현 불가능한 마술은 과학이 아니다
학계의 고질병
논문엔 멋진 결과 도표(Plot)만 달랑 올리고, 그 데이터를 어떻게 전처리했는지 파이썬 소스 코드는 '영업비밀'이라며 감추는 학자들이 널려 있습니다.
오픈 사이언스 혁명
데이터, 코드, 변수 정의서(Codebook), 프롬프트 원문까지 Github를 통해 100% 투명하게 대중에게 공개하십시오. 틀릴 용기, 비판받을 공간을 열어두는 것이 진정한 강건함(Robustness)입니다.
당신이 치명적인 오류(Error)를 코딩한 것을 발견한 후행 연구자가 당신의 치부를 세상에 까발렸을 때, 당신은 그것을 개인적 수치로 여길 것입니까 시스템의 승리로 여길 것입니까?
마지막 남은 질문: '의미'란 무엇인가?
기계학습 모델이 수만 장의 데이터를 분석해 "정부가 A 지역 예산을 깎으면, 3년 뒤 B 지역의 투표율이 15% 하락한다"는 정확한 예측(What)을 내놓았습니다.
그래서요? 이 숫자가 우리 인간 공동체의 본질(존엄성, 불평등, 분노)에 대해 '무슨 깊은 뜻(Why & Meaning)'을 지니는가?
컴퓨터는 '계산'할 뿐 '고뇌'하지 않습니다. 계산된 숫자 앞에서 잠을 설치고 뼈아프게 의미를 부여하는 그 지독한 고민의 시간이야말로 방법론의 최종 정착지임을 동의하십니까?