학습 목표:
수동적 데이터(Passive Data) vs 능동적 데이터(Active Data):
LLM의 전략적 조력:
핵심 방법론:
주요 위반 사례:
LLM 활용 혁신:
어떤 질문을 던지느냐에 따라 우리가 얻는 데이터의 '수준'이 결정됩니다.
LLM 혁신 워크플로우:
LLM의 사전 검증 역할:
실험 방법:
목표:
문항의 단어가 특정 그룹에게 불쾌감을 주거나 오해를 불러일으키는지 사전 점검.
예상되는 응답 분포를 가늠하여 '지지율 격전지' 시나리오를 미리 작성.
어디로 물어볼 것인가? (Mode Selection):
사후 보정 - 가중치(Weighting): 조사 결과 20대 응답자가 너무 적게 수집되었다면, 통계적으로 20대의 응답에 더 높은 가중치(Case Weight)를 곱해 전체 인구 비율에 맞춥니다. 이것이 여론조사의 과학적 '보정' 과정입니다.
"데이터가 훌륭해도 보여주지 못하면 죽은 데이터다." 시각화는 분석의 마지막 단계가 아니라, 유권자와 소통하는 '언어'입니다.
앤스컴의 4인조 (Anscombe's Quartet) 교훈:
평균, 분산, 상관계수가 소수점 셋째 자리까지 똑같은 4개의 데이터셋이 있습니다.
하지만 그래프로 그리는 순간, 어떤 것은 선형적이고 어떤 것은 극단적인 이상치가 있는 등 완전히 다른 모습이 드러납니다.
시각화의 목적:
불필요한 '차트 정크(Chartjunk)':
불필요한 3D 효과 (데이터 왜곡의 주범)
너무 화려한 배경 색상이나 무늬
중복된 축 눈금과 테두리
자기주도 과제:
Matplotlib (The Foundation):
Seaborn (The Stylist):
Plotly (The Interactive):
성공하는 4단계 구조화 프롬프트 (Context-Goal-Style-Analysis):
LLM 코드 생성 포인트:
시계열 데이터인 Date 컬럼을 판다스 datetime 객체로 변환하여 인덱스로 설정.
Line Chart를 통해 지지율의 상승·하락 추세(Trend)를 시각화.
핵심 시각화 기법:
"대한민국 시군구별 지지율 격차 데이터를 바탕으로, 격차가 크면 진한 색, 작으면 연한 색으로 표현하는 단계 구분도(Choropleth) 코드를 생성해줘. 특히 서울 지역만 줌인(Zoom-in)하는 기능도 넣어줘."
주요 왜곡 사례와 비판적 시각:
LLM 기반의 텍스트 분석 시각화:
왜 동적 시각화인가? 정적인 슬라이드 한 장은 질문에 대한 답변만 주지만, 동적 대시보드는 결정권자(정치인, 전략가)가 직접 데이터를 탐험하며 '새로운 질문'을 던지게 합니다.
분석 포인트:
구체적 요구사항:
LLM에게 데이터 구조를 설명하고 시각화 코드 초안을 출력받아 실행합니다.
코드 주석에 각 그래프가 어떤 정치적 질문에 답하기 위해 만들어졌는지 기록합니다.
수행 절차:
Seaborn의 FacetGrid를 활용해 '지역별'로 나눠진 '연령대별 지지율' 멀티 그래프를 구현합니다.
핵심 지식 재정리:
용도별 파이썬 시각화 삼각 편대(Mat/Sea/Plotly) 활용법.
LLM을 시각화 비서로 부리기 위한 '구조화된 프롬프트' 전략.
데이터 왜곡을 방지하기 위한 시각화 윤리와 인지 심리학 원칙.
섹션 목표:
신뢰도 (Reliability) - '일관성의 미학':
타당도 (Validity) - '정확성의 본질':
정치 분석에서의 예시:
LLM의 고급 조력:
실제 교정 사례:
표집 방식의 차이:
LLM의 페르소나별 유도 문구:
LLM 지시어(Chain of Thought):
"먼저, 이 주제와 관련된 기존 연구들의 핵심 변수를 정리해줘."
"그 변수들을 측정하기 위한 인구통계 질문 4개와 인식 질문 10개를 리커트 척도로 만들어줘."
"질문들 사이에 논리적 흐름(Flow)이 끊기지 않도록 순서를 배치해줘."
투사법 및 간접 질문:
"당신은 누굴 지지합니까?" 대신 **"당신의 가장 친한 친구 3명은 대략 누굴 지지하는 것 같습니까?"**라고 묻습니다. 사람들은 자신의 생각을 남에게 투사하는 경향이 있습니다.
무작위 할당(Randomization) 실험:
오염된 데이터 걸러내기:
필수 포함 사항:
핵심 정리: