데이터 수집의 핵심 원리 배우기
연구 목적과 맞는 변수를 뽑아야 함 → 질문을 잘못 만들면 연구 자체가 잘못됨
흔히 말하는 "Garbage in, garbage out" = 잘못된 자료를 넣으면 잘못된 결론이 나온다
❌ 잘못된 질문: “당신은 공부를 좋아합니까?” (모호함)
✅ 좋은 질문: “하루 평균 몇 시간 공부합니까?” (측정 가능)
학교 만족도 조사: “학교 시설 만족도”를 1점~5점으로 평가 → 전체 학생들의 경향을 쉽게 파악 가능
❌ 나쁜 질문: “당신은 학교 수업이 재미있다고 생각합니까?” (모호함, 개인적 해석 차이)
✅ 좋은 질문: “지난주 수업 중 가장 흥미롭게 들은 과목은 무엇입니까?” (구체적, 측정 가능)
❌ 나쁜 질문: “당신은 공부를 많이 합니까?” (애매함, 기준 불명확)
✅ 좋은 질문: “하루 평균 몇 시간 정도 공부합니까?” (수치형 답변 가능)
❌ 나쁜 질문: “학교 급식이 맛있나요?” (주관적, 이분법적)
✅ 좋은 질문: “학교 급식 맛에 대해 1~5점 중 몇 점을 주겠습니까?” (척도형, 비교 가능)
❌ 나쁜 질문: “동아리 활동이 유익했나요?” (막연함)
✅ 좋은 질문: “동아리 활동을 통해 얻은 가장 큰 성과는 무엇입니까? (예: 친구 사귀기, 실력 향상, 대회 준비 등)”
❌ 나쁜 질문: “스마트폰을 자주 쓰나요?” (주관적, 모호함)
✅ 좋은 질문: “하루 평균 스마트폰 사용 시간은 몇 시간입니까?”
❌ 나쁜 질문: “당신은 요즘 스트레스를 받나요?” (네/아니오 응답은 불충분)
✅ 좋은 질문: “학교생활에서 가장 큰 스트레스 원인은 무엇입니까? (시험/숙제/관계/기타)”
❌ 나쁜 질문: “주말에 여가를 잘 보내나요?” (애매함)
✅ 좋은 질문: “주말에 가장 많이 하는 활동은 무엇입니까? (예: 운동, 게임, 공부, 외출 등)”
❌ 나쁜 질문: “환경 보호에 관심이 있습니까?” (막연, 사회적 바람직성 편향 발생)
✅ 좋은 질문: “지난 한 달 동안 환경 보호를 위해 실천한 행동이 있습니까? (예: 분리수거, 텀블러 사용 등)”
❌ 나쁜 질문: “당신은 정치에 관심이 있습니까?” (너무 일반적)
✅ 좋은 질문: “지난 1년간 뉴스를 통해 정치 관련 뉴스를 얼마나 자주 접했습니까? (매일/주 1~2회/거의 없음)”
❌ 나쁜 질문: “용돈을 잘 쓰나요?” (추상적)
✅ 좋은 질문: “한 달 평균 용돈 중 가장 많은 비율을 쓰는 곳은 어디입니까? (간식/게임/교통/기타)”
| 구분 | 장점 | 단점 | 예시 |
|---|---|---|---|
| 자유응답형 (개방형) | 다양한 아이디어 확보 | 응답 부담, 분석(코딩) 어려움 | "학교 급식에서 개선이 필요한 점은 무엇입니까?” |
| 다지선다형 | 응답 빠름, 분석 용이 | 모든 가능한 응답 포함해야 함 | "학교 급식에서 가장 만족스러운 부분은?" |
| 양자택일형 | 응답 간단 | 너무 극단적 → “모르겠다/보통” 항목 추가 필요 | "만족하십니까? 예/아니오" |
| 구분 | 특징 | 장점 | 단점 |
|---|---|---|---|
| 전수조사 (Census) | 모집단 전체 조사 | 정확함 | 시간·비용 ↑, 현실적 한계 |
| 표본조사 (Sample Survey) | 일부만 조사하여 전체 추정 | 시간·비용 ↓ | 대표성 부족 시 결과 왜곡 가능 |
전수조사는 완벽하지만 비효율적이고, 표본조사는 경제적이지만 대표성 확보가 관건입니다.
① 모집단 확정 → ② 표본 프레임(명부) 확정 → ③ 표본추출 방법 결정 → ④ 표본 크기 결정 → ⑤ 표본 추출 실행
| 구분 | 특징 | 장점 | 단점 | 예시 |
|---|---|---|---|---|
| 확률 추출 | 무작위, 모든 구성원이 뽑힐 확률 > 0 | 대표성 ↑, 일반화 가능 | 준비(표본 프레임 필요) 어려움 | 무작위로 학번 뽑기 |
| 비확률 추출 | 조사자 편의/판단에 의존 | 시간·비용 ↓, 빠름 | 대표성 부족, 편향 위험 | 교실 앞줄만 조사, 전문가만 뽑기 |
전교생 1000명 중 50명을 무작위로 추출하는 실습 예제입니다.
import numpy as np
# 모집단 학생 수
population_size = 1000
# 추출할 표본 크기
sample_size = 50
# 1~1000번 학생 중 50명 무작위 추출 (중복X)
sample = np.random.choice(a=population_size, size=sample_size, replace=False)
print(f"추출된 표본 (학생 번호): {sample}")
# 실제 연구에서는 np.random.seed(123) 같은 난수 시드를 설정해 재현 가능