Week 11. 생성형 AI 활용 1 (Generative AI in Research 1)
제11주차. 생성형 AI 활용 1 자료 수집, 프롬프트 엔지니어링 및 다중 에이전트 시스템
연구 보조자로서의 LLM: 전처리의 혁신
학습의 목적
단순한 질의응답을 넘어 대규모 언어 모델(Claude 등)을 학술 연구의 '정밀한 자동화 도구'로 활용하는 방법을 배웁니다. 데이터 수집부터 복잡한 질적 코딩의 자동화까지 실무적 감각을 익힙니다.
도구의 진화
기계학습 전문가만 다룰 수 있던 텍스트 알고리즘이 이제 프롬프트(자연어 지시문)를 통해 누구나 사용할 수 있는 범용 도구로 진화했습니다.
우리가 연구 과정을 효율화하기 위해 AI에게 코딩을 맡기는 것은 학문적 혁신일까요, 아니면 연구자의 관찰 의무를 저버리는 책임 회피일까요?
주차 목차
Table of Contents
데이터 수집에서 분석 자동화까지
Part 1. 자동화된 수집: 웹 스크래핑과 API를 통한 비정형 데이터 확보
Part 2. 프롬프트 엔지니어링의 정석: AI에게 정확하게 명령하는 기법
Part 3. Zero-shot & Few-shot 코딩: AI를 질적 코더로 훈련시키기
Part 4. 다중 에이전트 시스템 (Hades 등): 여러 AI의 결합 관현악
Part 5. 신뢰도 검증: 인간 vs AI의 Inter-coder Reliability 측정
Part 6. 시스템 평가: 환각(Hallucination)의 통제방안
만약 AI가 인간 코더 간의 신뢰도(0.7)보다 더 높은 일관성(0.9)으로 문서를 분류해 낸다면, 우리는 그 AI의 무의식적 편향조차도 '더 나은 객관적 지표'로 받아들여야 할까요?
웹 스크래핑의 새로운 패러다임
Automated Data Collection
과거의 고통과 현재의 마법
전통적 웹 스크래핑
BeautifulSoup이나 Selenium을 이용해 HTML의 `<div>`, `class` 태그 구조를 뜯어보고 정규표현식으로 텍스트를 발라내야 했습니다. (사이트가 개편되면 코드가 무너짐)
LLM을 활용한 파싱 (Parsing)
웹 페이지의 지저분한 원시 텍스트나 HTML을 통째로 LLM의 컨텍스트 윈도우에 밀어 넣고, "이 안에서 발언자, 발언 내용, 날짜만 뽑아서 JSON으로 줘"라고 명령합니다.
LLM이 너무도 쉽게 텍스트를 구조화해 주지만, 그 과정에서 원본 데이터에 없던 단어를 미세하게 추가하거나 윤색(환각)한다면, 증거로서의 능력이 상실되는 것은 아닐까요?
프롬프트 엔지니어링
Prompt Engineering
"AI를 똑똑하게 부리는 주문서 작성법"
프롬프트 엔지니어링은 단순히 '질문하기'가 아닙니다. AI 모델(특히 Claude 3 같은 고도화된 모델)이 가장 적은 오류로, 가장 모호함 없이, 일관된 결과물의 형태를 내놓도록 지시를 프로그래밍하는 행위입니다.
Anthropic 프롬프트 가이드라인 핵심
명확하고 구체적으로 (Be clear & direct): 두루뭉술한 지시는 최악의 결과를 낳습니다.
XML 태그 활용: 클로드는 ``, ``, `` 형태의 XML 태그 구조를 인식하는 데 매우 뛰어납니다.
명확하게 지시하려면 연구자가 이미 '원하는 결과의 구조'를 알고 있어야 합니다. 그렇다면 발견적(Exploratory) 연구에서는 LLM을 어떻게 써야 할까요?
XML 태그를 활용한 프롬프트
Claude's Best Practice
"구조화된 지시문이 쓰레기를 방지한다"
당신은 최고의 정치학 데이터 분석가입니다.
1. 주어진 텍스트에서 '권위주의적 태도'가 나타나는 문장을 추출하세요.
2. 발견되지 않으면 무리해서 날조하지 말고 "없음"으로 응답하세요.
3. 결과는 반드시 JSON 형태로 출력하세요.
"우리의 위대한 영도자를 모욕하는 자들은 사회의 안정을 위해 즉각 투옥되어야 마땅하다."
{
"detected": true/false,
"evidence_sentence": "원문 문장",
"rationale": "판단 근거"
}
태그로 지시를 완벽히 통제했는데도 LLM이 환각을 일으킨다면, 그것은 모델의 한계일까요, 아니면 프롬프터의 정의(Definition)가 모호했던 탓일까요?
제로샷 (Zero-shot) 라벨링
Minimal Guidance
아무런 예시 없이 분류 지시하기
방식
사전 학습된 모델의 기본 지식을 믿고, 예제 제공 없이 곧바로 분류 기준(Codebook)만 주고 코딩을 시킵니다.
"다음 트윗이 혁신지향형인지 유지지향형인지 분류하시오."
장단점
매우 빠르고 프롬프트 구성이 쉽습니다. 하지만 정치학 특유의 고맥락(비꼬기, 함의 등) 언어에서는 일치도(Reliability)가 치명적으로 떨어집니다.
제로샷으로 분류된 수만 건의 데이터를 우리는 논문에 양적 데이터로 사용할 수 있을까요?
퓨샷 (Few-shot) 라벨링
Learning by Example
연구자의 코딩북을 AI에게 이식하기
프롬프트 내에 연구자가 직접 손으로 판별한 모범 사례(Gold Standard Exampes)를 여러 개(3~5개) 제시하여, LLM이 연구자의 판단 논리를 '모방'하도록 유도합니다.
[예시 1] 원문: "집값이 오르는 건 다 전 정부 탓이다." → 라벨: [책임회피] [예시 2] 원문: "세계적 인플레이션으로 어쩔 수 없다." → 라벨: [외부요인 귀인] [명령] 자, 이제 이 기준에 맞춰서 다음 10,000개의 문장을 코딩하라.
몇 개의 예제(Shot)를 주는 것이 효율성에 도움이 될까요? 너무 많은 예제는 모델의 컨텍스트 윈도우를 과부하시켜 오히려 성능 저하를 일으키지 않을까요?
사고의 사슬 (Chain of Thought, CoT)
Reasoning Process
"답을 말하기 전에 먼저 생각해라"
CoT 프롬프팅
LLM에게 즉각적으로 분류 결과만 내놓으라고 하지 않고, 판별을 하기까지의 단계적인 논리적 과정을 먼저 서술하도록 강제하는 방법입니다.
"Think step by step."
`` 태그 활용: "여기에 당신의 판단 근거를 먼저 적으시오."
결과: 환각(Hallucination)이 극적으로 줄어들고 복잡한 코딩의 정확도가 올라갑니다.
기계가 '논리적으로 추론'하는 것처럼 보일 뿐, 사실은 학습된 토큰의 통계적 확률 분포를 나열하는 것에 불과하다면, CoT가 성능을 올리는 원리는 무엇일까요?
Anthropic의 문서 분석 사례
Extracting Key Entities
방대한 정책 문서에서의 실전 추출
수백 페이지짜리 미국 연방준비제도(Fed) 회의록에서 '금리 인상'에 대한 강경파(Hawk)와 온건파(Dove)의 뉘앙스를 추출하고 싶습니다.
첨부된 회의록에서 다음을 추출해:
1. 금리에 대한 맥락
2. 의원의 스탠스 (Hawk/Dove)
3. 주장의 근거
Claude의 200K 토큰 창을 활용하면 문서를 자르지 않고 통째로 집어넣은 뒤, 거시적 흐름 안에서 미세한 발언자들의 태도 변화를 추출해 낼 수 있습니다.
텍스트의 어떤 부분이 '매파'인지 규정하는 것은 고도의 정치 경제적 판단입니다. 이 판단을 AI에 아웃소싱하면 논문의 저자는 누구입니까?
도구 활용 (Tool Use / Function Calling)
AI with Hands
자신의 한계를 알고 외부 도구를 쓰는 AI
개념
LLM에게 계산기, 웹 검색기, 데이터베이스 조회 API 등의 '도구(함수)'를 쥐여주고, 필요할 때 스스로 उस 도구를 호출하여 그 결과를 바탕으로 답변하게 하는 기술입니다.
왜 중요한가?
LLM은 수학적 계산에 약하며, 사전 학습이 끝난 이후의 최신 정보를 모릅니다. 환각을 방지하고 결정론적이고 정확도 높은 데이터 관상(Grounding)을 보장합니다.
정치 분야에서 AI에게 '통계청 API' 접근 권한을 주었을 때, AI가 이를 이용해 실시간 투표율을 분석해낸다면 분석의 주체는 시스템입니까, 설계자입니까?
다중 에이전트 시스템 기초
Multi-Agent Orchestration
하나의 AI가 아닌 AI들의 '오케스트라'
복잡한 연구 과제(예: 1만 건의 국정감사 질의 분석)를 하나의 LLM에게 몰아주면 쉽게 피로(성능 저하)를 느끼고 길을 잃습니다.
Manager Agent: 전체 목표를 쪼개어 하위 에이전트에게 할당.
Extractor Agent: 문서에서 핵심 문장만 전문적으로 추출.
Coder Agent: 추출된 문장에 라벨링.
Reviewer Agent: 결과물의 타당성 감사(Audit).
마치 지도 교수가 대학원생 팀을 운영하듯, AI 에이전트들이 서로의 결과물을 비판하고 검증(Cross-check)하도록 파이프라인을 설계합니다.
에이전트끼리 서로 비판하도록 설계했다면 집단지성이 생길까요, 아니면 집단적 환각(Echo Chamber)이 생길까요?
에이전트 결합: Hades 프레임워크 사례
Hades in Action
전문적 통제를 위한 다중 라우팅 구조
Routing Architecture
사용자의 큰 명령이 들어오면 거대한 루팅 에이전트가 "이것은 데이터 수집 작업인가, 질적 코딩 작업인가?"를 판단하여 특화된 모델 프롬프트 조합으로 작업을 넘깁니다.
*각 에이전트는 자신만의 Tool과 Prompt를 가짐
특화된 에이전트로 쪼개어 작업할 때 발생하는 '전체 맥락 파악 능력의 상실(Fragmentation)'을 어떻게 보완해야 합니까?
연구 신뢰도: 인간과 기계 사이
Inter-Coder Reliability with AI
AI가 코딩한 것을 어떻게 믿을 것인가?
연구자가 임의로 "ChatGPT가 다 코딩했습니다"라고 논문에 쓰는 것은 매우 위험합니다. AI를 하나의 독립된 휴먼 코더처럼 대우하여 검증해야 합니다.
검증 프로토콜
전체 코딩 데이터 중 5~10%를 무작위 추출.
인간 연구자가 이 샘플을 수동으로 코딩.
동일한 샘플을 LLM이 코딩.
둘 사이의 Cohen's Kappa 계산. ($\kappa > 0.8$ 목표)
만약 일치도가 낮다면? AI를 교체하기 전에 당신의 '코딩북(프롬프트)'과 판단 기준이 모호하지 않은지 먼저 반성해야 합니다.
일치도를 높이기 위해 프롬프트를 계속 깎아나가는 과정이, 사실은 AI를 '나의 편견'에 맞추어 과적합(Overfitting)시키는 과정은 아닐까요?
환각(Hallucination)의 통제
Controlling AI Bullsh*t
존재하지 않는 사실을 지어내는 기계
위험성
정치 데이터를 요약하라고 했더니 기사에 없는 제3의 인물을 끌어들여 문맥을 부드럽게 윤색합니다. 언어 모델의 근본적 특성(확률적 생성) 때문입니다.
통제 기법
온도(Temperature) 하향: 파라미터를 0(Deterministic)으로 세팅.
엄격한 룰: "주어진 텍스트 내에서만 인용해. 발견되지 않으면 없다고 말해라." 프롬프팅.
Citation 요구: "너의 결론이 텍스트의 몇 번째 문단인지 원문을 병기하라"고 지시.
환각이 완전히 제거된 AI는 인간의 창의성이나 예상치 못한 통찰(Serendipity)을 제공하는 능력마저 거세당한 것은 아닐까요?
Anthropic의 분류(Classification) 사례
Claude Use Case
고객 리뷰에서 정치적 담론 분류로의 응용
당신은 정치학 연구를 보조하는 숙련도 코더입니다.
아래 제공되는 트위터 데이터를 읽고, 담론의 방향을 분류하세요.
제공된 카테고리 ['입법_촉구', '제도_비판', '인물_비방', '정보_공유'] 에 한정해야 합니다.
# 퓨샷 예시들 제공...
"어제 국회 본회의에서 최저임금법 통과 안 된 거 실화냐?
다들 밥그릇 챙기느라 바쁘네. 당장 재논의해라!"
이 짧은 텍스트에 '제도 비판'과 '입법 촉구(당장 재논의해라)'가 섞여 있습니다. 상호배타적이지 않은 코딩을 단일 라벨로 강제하는 것은 온당할까요?
온톨로지(Ontology)와 메타데이터 추출
Structured Extraction
비정형 텍스트를 정형 데이터베이스로 전환
수천 건의 외교 성명서를 읽고, [발생일], [핵심 행위자], [분쟁 대상 국가], [강경도 1-5 척도] 라는 열(Column)을 가진 CSV 레코드로 변환하는 작업이 LLM의 가장 큰 강점입니다.
활용 팁: JSON Schema나 Pydantic 모델을 시스템 프롬프트에 제공하여, 파이썬 코드에서 바로 `df.from_records()` 할 수 있는 무결점 데이터를 뽑아냅니다.
인간이 직접 표를 채워 넣는 고된 과정 속에서 우연히 발견되는 파생적 아이디어 창출(Idea generation)의 기회비용은 얼마나 될까요?
동적 프롬프팅 (Dynamic Prompting)
Programmatic Generation
반복문(Loop) 안의 AI
개념
하나의 거대한 프롬프트로 1만 개를 묶어 돌리는 것이 아닙니다. 파이썬 코드 루프(For-loop) 안에서 건당 개별적으로 변수(이름, 날짜)를 교체하여 프롬프트를 동적으로 주입합니다.
import anthropic
for text in df['speeches']:
prompt = f"""다음 연설문({text})에서..."""
response = client.messages.create(
model="claude-3-opus-20240229",
messages=[{"role": "user", "content": prompt}]
)
# 데이터베이스에 저장
수만 번의 API 호출에 들어가는 막대한 토큰 비용(비용 격차)은 자본이 부족한 개발도상국 연구자들의 정치학 연구 진입 장벽을 높이지 않을까요?
프롬프트 평가 프레임워크
Evaluating LLMs
내 지시문은 과연 좋은 프롬프트인가?
프롬프트를 바꾼 후 그것이 개선인지 개악인지 감으로 판단하면 안 됩니다.
골드 데이터셋 테스트
미리 정답(Ground Truth)을 알고 있는 100건의 데이터를 프롬프트 버전 1과 버전 2에 각각 돌려본 후, 정답률(Accuracy, F1-Score)의 수치 변화를 관측하여 버전 관리를 합니다.
Tip: 프롬프트를 튜닝할 때는 한 번에 하나의 지시사항만 변경(A/B 테스트)해야 원인을 추적할 수 있습니다.
우리가 '정답'이라고 믿고 만들어 놓은 100건의 데이터 자체가 이미 연구자의 낡고 편향된 관점에 오염되어 있다면요?
어조(Tone) 분석의 함정
Tone and Style
AI가 감지하는 뉘앙스와 문화적 맹점
능력의 한계지점
LLM은 대체로 영어권, 특히 미국의 인터넷 담론을 기반으로 학습되었습니다. 따라서 한국 정치 담론 특유의 사투리 비유, 한자어 은유, 유교적 맥락의 돌려 말하기를 곡해할 위험이 큽니다.
"의원님 참으로 수고하십니다" → [미국 AI]: 긍정적인 평가 및 감사 표현으로 코딩함.
[한국적 맥락]: 상황에 따라 극도의 비아냥과 질책의 레토릭일 수 있음.
특정 문화권의 미묘한 '비꼬기'를 포착하기 위해서는 프롬프트 안에 문화적 배경지식(Context)을 어디까지 상세히 기술해야 할까요?
멀티모달 모델의 코딩
Image to Text Extraction
선거 포스터와 시위 피켓의 정량화
생성형 AI(Claude 3, GPT-4o 이후 버전)는 이미지 인식(Vision)이 가능합니다.
스캐너로 밀어야 했던 물리적 선거 홍보물, 인스타 웹 자보 등의 사진을 넣고 "후보자의 복장, 주요 강조 키워드, 사용된 메인 컬러, 적대자의 묘사 방식을 추출해" 라고 명령할 수 있습니다.
시각 정보의 구조화
과거에는 '연구팀 20명의 노동'이 필요했던 시각 자료 코딩이 자동화되며, 디지털 시각 정치학(Visual Politics) 분석의 허들이 급격히 낮아졌습니다.
AI가 사진에서 '분노한 사람의 표정'으로 코딩했는데 인간 코더는 '결의에 찬 표정'으로 코딩했다면 이 시각적 주관성의 싸움은 누가 승리합니까?
데이터 증강 (Data Augmentation)
Creating Synthetic Data
없는 데이터 만들어내기: 연구의 윤리적 딜레마
소수 클래스 보완
혐오 표현을 분석하려는데 데이터 1만 건 중 진짜 혐오 표현은 30건 뿐이라 통계를 돌릴 수 없습니다. 이때 AI에게 "이 30건의 스타일과 유사한 가짜 혐오 표현 500건을 창작해달라"고 요청합니다.
합성 데이터의 활용
이 합성된 문장들을 머신러닝 학습 파이프라인에 재사용합니다. 부족한 샘플링 한계를 극복하는 혁신으로 각광받고 있습니다.
우리가 기계가 만든 '존재한 적 없는 가짜 데이터'로 학습된 결과를 현행 선거법 위반 판단의 근거로 사용하는 것이 절차적으로 정당할까요?
연구 윤리와 투명성
Researcher Responsibility
AI 활용 사실을 어디까지 고백해야 하는가?
학술지 가이드라인: 논문의 핵심 주장이나 결론 작성에 AI를 사용할 수는 없으나, 코딩 보조나 번역 등에는 활용할 수 있다고 명시하는 추세.
재현성(Reproducibility) 위기: 폐쇄적 상용 API(예: GPT-4)는 업데이트 시마다 답변이 달라지므로, 오늘 내가 코딩한 결과가 1년 뒤 후행 연구자에게 재현되지 않습니다.
대안: 사용한 모델 버전, Temperature, 프롬프트 원문을 논문 부록에 투명하게 공개해야 합니다.
오픈소스 모델(Llama 등)을 로컬에 다운받아 코딩했다면 그 가중치가 영구 보존되므로 재현성 위기에서 탈출했다고 볼 수 있을까요?
비용과 스케일의 경제학
Tokens to Dollars
정치 데이터의 '계산 청구서'
LLM API는 단어(Token) 단위로 과금됩니다. 수만 건의 법안을 분석할 때 프롬프트를 1문장만 줄여도 전체 비용이 수백만 원씩 절약됩니다.
프롬프트의 경제성: 최대한 간결하고 정제된 지시, 불필요한 시스템 인사말(예: "네, 도와드리겠습니다")을 금지하는 세팅이 필수입니다.
일괄 처리 (Batch Processing)
하나씩 묻고 답하는(Synchronous) 비싼 처리 대신, Claude의 Batch API처럼 1만 개의 작업을 파일로 던져놓고 24시간 뒤에 저렴하게 찾아가는 방식이 대규모 연구의 핵심으로 부상했습니다.
자본의 크기가 연구와 질문의 스케일을 결정하는 현 시점을 볼 때 데이터 독점은 결국 학문의 양극화로 이어지는 것 아닐까요?
실무 코드 (API 호출)
Python with Anthropic
연구 파이프라인의 뼈대
import anthropic
client = anthropic.Anthropic(api_key="sk-...")
def extract_policy(text):
response = client.messages.create(
model="claude-3-haiku-20240307", # 대량 처리를 위한 빠르고 경제적인 모델
max_tokens=1000,
temperature=0, # 환각 통제
system="넌 분석가야. XML 형식만 내놓고 부연설명은 금지.",
messages=[
{"role": "user", "content": f"{text}\n핵심 공약 3개 추출해."}
]
)
return response.content[0].text
성능이 높은 고가의 모델(Opus) 1개를 쓸지, 저렴한 하위 모델(Haiku)을 여러 번 돌려 Cross-check할지, 연구 비용의 최적점은 어디일까요?
정치학에서의 패러다임 시프트
Paradigm Shift
방법론자의 역할이 변한다
과거의 정치학도
SPSS, Stata 마우스 버튼 누르기. 파이썬 문법 에러와 사투 구현 패키지가 작동하지 않아 밤을 새웠습니다.
현재와 미래의 정치학도
구현(Code)은 AI가 순식간에 작성합니다. 핵심은 "어떤 질문(Prompt)을 던질 것인가", 그리고 도출된 결과의 "논리적 허점(Validity)을 어떻게 찔러 교정할 것인가" 하는 통찰 기획력으로 무게중심이 이동했습니다.
코딩 스킬 자체의 가치가 하락한다면, 앞으로 학부 방법론 강의에서 우리는 학생들에게 '파이썬'을 가르쳐야 합니까, '비판적 독해력'을 가르쳐야 합니까?
편향성의 재귀적 상속
Inherited Bias
인터넷의 쓰레기, 모델의 영혼이 되다
LLM은 웹상의 글들을 먹고 자랐습니다. 따라서 인터넷 공간을 장악한 보수적(혹은 진보적), 남성 중심적, 서구 백인 중심적 편향이 모델의 기저 가중치에 무겁게 짓눌려 있습니다.
이 모델로 정치 텍스트를 코딩하게 하면 AI는 중립적 척결자가 아니라 "사회의 기존 다수결 편견을 가속(Feedback Loop)시키는 존재"가 됩니다.
"AI는 중립적이지 않다. 그것은 단지 인간 사회의 차별을 가장 우아한 수학식으로 포장한 결정체다."
우리는 AI의 코딩 결과에 잠재된 이 사회적 편향성을 보정하기 위해, 결과물에 '인위적인 역가중치'를 주는 방식의 통계적 땜질을 허용해야 할까요?
연구 데이터 보안
Privacy and Security
내부 문건을 API 소켓에 던져도 되는가?
비식별화 보호가 되지 않은 국정원 문건이나 정당 내부 회의록 등 민감한 정보를 분석하기 위해 ChatGPT 서버로 전송하는 행위는 치명적인 연구 보안 위반입니다.
Cloud/API: 기업의 데이터 활용 정책 확인 필수 (Anthropic은 API 데이터로 자사 모델 학습을 금지하는 정책을 도입함).
On-Premise: 궁극적으로는 연구실 내 로컬 서버에 소형 오픈소스 모델(Llama)을 구축해 인터넷 없이 분석하는 것이 보안 통제의 길입니다.
"연구 보안보다 분석 효율이 먼저다" vs "단 한 줄의 민감 정보라도 유출되어선 안 된다." 대규모 정치 데이터 시대에 어느 쪽에 서야 합니까?
개방성 모델과 폐쇄성 모델
Open vs Closed
API 블랙박스의 정치학
폐쇄형 (OpenAI, Anthropic)
성능은 압도적이지만 내부 작동 원리와 구조가 감춰져 있습니다. 연구자는 그저 던져진 결괏값만 믿고 논문을 써야 하는 종속적 위치에 처합니다.
개방형 (Llama, Mistral)
코드가 공개되어 있어, 학계에서 투명하게 원리에 대한 상호 검증이 가능합니다. 민주적 통제와 데이터 주권(Sovereignty) 확보의 측면에서 유리합니다.
거대 빅테크들의 API 구독료에 모든 대학이 종속될 때 학문의 민주적 지형은 어떻게 변모할까요?
실패 사례의 교훈
Lessons from Failures
우리는 왜, 어떻게 실패하는가?
게으른 프롬프팅: 코딩북 개발 과정의 갈등 구조를 생략하고 "알아서 잘 분류해줘"라고 던졌을 때 발생하는 무의미한 결과.
신뢰도 과도 확신: AI도 당연히 실수하며 기계적 피로도(문서 토큰 한계 도달 시 집중력 하락)가 존재함을 무시하는 태도.
학문적 비만의 패러독스: 1만 개의 문서를 처리했다는 자랑 뒤에, '정작 이 문서들이 왜 탄생했는지' 단 한 사람의 저자와도 인터뷰를 하지 않는 현장감 부재.
기술이 모든 데이터를 볼 수 있게 해 주더라도 '무엇을 보지 않을 것인가'를 선택하는 연구자의 단절(Disconnect) 의지가 왜 중요합니까?
주차 요약
Summary
AI, 연구자의 손과 발이자 거울
지능의 도구화: LLM은 지저분한 비정형 정치 데이터를 다루기 쉬운 정보의 형태로 바꾸는 혁명적인 도터 수집/정제 도구(Extractor)입니다.
소통의 기술: 명확하고 구조화된 프롬프트 엔지니어링, Few-shot 삽입, XML 태그 활용이 쓰레기 결과물(Garbage Out)을 막는 유일한 방패입니다.
체계의 고도화: 단순 1:1 대화형 창구를 넘어서 여러 AI 에이전트들을 결합하여 상호 교차 검증시키는 다중 에이전트 프레임워크 구축이 학술연구의 핵심입니다.
인간의 책임: 신뢰도 평가는 반드시 인간이 수행해야 하며, 편향과 환각에 오염된 기계에 맞서 학술적 타당성의 핸들을 놓지 말아야 합니다.