2025년 2학기 계량분석 강의자료

4주차: 연구문제와 가설검정

✦ 연구문제와 가설의 기본 원리

1. 연구문제의 설정

연구문제란?

→ "내가 무엇을 알고 싶은가?"를 명확하게 정의하는 **질문**.

좋은 연구문제의 조건

  1. 새로운가? → 기존 연구와 **차별성**이 있는가?
  2. 중요한가? → 사회·학문적으로 **의미** 있는 문제인가?
  3. 가능한가? → 내가 가진 시간·능력·자료로 **해결**할 수 있는가?

📌 예시

❌ 너무 광범위한 문제: “행복이란 무엇인가?”

✅ 구체적인 문제: “고등학생의 스마트폰 사용 시간이 학업 성취도에 영향을 미치는가?”


2. 연구문제 제기 4단계

  1. 연구문제 선정
    • 관심 주제를 정한다.
    • 예: "스마트폰 사용과 성적의 관계"
  2. 문헌 고찰 (선행연구 검토)
    • 이미 발표된 연구들을 살펴본다.
    • 예: "성인 대상 연구에서는 스마트폰 사용이 집중력에 부정적 영향을 준다"
  3. 연구가설 설정
    • 변수 간의 관계를 예측한다.
    • 예: "스마트폰 사용 시간이 많을수록 성적은 낮을 것이다."
  4. 연구문제 구체화
    • 용어를 정의하고, 측정 가능한 방식으로 바꾼다.
    • 예:
      • 스마트폰 사용 = 하루 평균 사용 시간
      • 성적 = 최근 시험 평균 점수

3. 가설의 종류

귀무가설 (H0)

연구가설 (Ha)

👉 연구의 과정은 귀무가설(H0)을 기각할 근거를 찾는 것

가설검정의 기본 개념 및 절차

1. 가설검정의 정의

가설검정 (Hypothesis Testing):

→ 모집단(전체 집단)에 대한 주장이 맞는지 틀린지를 표본 자료를 이용해 판단하는 통계적 절차

원리:

📌 예시


2. 가설검정의 절차 (5단계)

  1. 가설 설정
    • 연구문제에 맞춰 H0, Ha를 세운다.
  2. 유의수준($\alpha$) 결정
    • 보통 0.05 (5%) 사용
    • 의미: "100번 중 5번은 우연히 잘못된 결론을 내릴 수도 있다."
  3. 검정통계량 계산
    • 표본 평균, 분산 등을 활용하여 수식으로 계산 ($t, Z, \chi^2$ 등)
    • 📌 이 수업에서는 개념 이해 중심으로 진행
  4. 기각 규칙 결정
    • 두 가지 방법
      • 임계값 방법: 계산된 통계량이 임계값을 넘으면 H0 기각
      • P값 방법: $P < \alpha$ → H0 기각
  5. 결론 내리기
    • H0 기각 → 연구가설 채택
    • H0 기각 못함 → 연구가설을 뒷받침할 증거 부족

3. P값 (P-value)과 임계값 (Critical Value)

P값:

임계값:

📌 쉽게 비유

  • 가설검정은 “표본을 통해 모집단의 주장(H0)이 맞는지 확인하는 절차”
  • 귀무가설(H0)은 기본 가정, 연구가설(Ha)은 연구자의 주장
  • 유의수준($\alpha$): 잘못된 결론을 허용할 확률 (보통 5%)
  • $P값 < \alpha$ → H0 기각
  • 임계값 방법P값 방법은 결론을 내리는 두 가지 방식

가설검정 실습 (Python)

1. 가설검정 예제

📌 문제 상황

(1) 1단계: 가설 설정

(2) 2단계: 유의수준 결정

(3) 3단계: 검정통계량 계산

공식:

$$Z = \frac{\bar{x} - \mu}{\sigma / \sqrt{n}}$$

대입:

$$Z = \frac{6.1 - 6.0}{0.2 / \sqrt{30}} \approx 2.74$$

2. Python 실습

import numpy as np
from scipy import stats

# 데이터 설정
mu = 6.0              # 모집단 평균 (H0)
sample_mean = 6.1     # 표본 평균
sigma = 0.2           # 모집단 표준편차
n = 30                # 표본 크기
alpha = 0.05          # 유의수준

# 검정통계량 (Z-값)
z_score = (sample_mean - mu) / (sigma / np.sqrt(n))
print(f"검정통계량 (Z-값): {z_score:.2f}")

# 양측검정 P값
p_value = 2 * (1 - stats.norm.cdf(abs(z_score)))
print(f"P값: {p_value:.4f}")

📌 실행 결과


3. 결과 해석

  • 가설검정은 표본 평균과 모집단 평균의 차이가 우연인지, 실제 차이인지를 판별하는 과정이다.
  • P값이 작으면(H0가 맞을 확률이 거의 없으면) → 귀무가설 기각
  • 이번 사례에서 세제 평균 무게는 6kg이 아니므로 → 공정 수정 필요

유의수준($\alpha$)에 따른 결론 비교

1. 다시 문제 정리


2. 유의수준($\alpha$)에 따른 판단


3. Python 코드 비교

# 위에서 계산된 P값 사용
p_value = 0.0062

alpha_1 = 0.05
alpha_2 = 0.01

print(f"P값: {p_value:.4f}\n")

if p_value < alpha_1:
    print("유의수준 0.05: 귀무가설 기각 → 공정 수정")
else:
    print("유의수준 0.05: 귀무가설 채택 → 공정 유지")

if p_value < alpha_2:
    print("유의수준 0.01: 귀무가설 기각 → 공정 수정")
else:
    print("유의수준 0.01: 귀무가설 채택 → 공정 유지")

📌 실행 결과

유의수준 0.05: 귀무가설 기각 → 공정 수정
유의수준 0.01: 귀무가설 채택 → 공정 유지

4. 해석

  • $\alpha$는 “틀릴 수도 있는 확률 한계치”
  • $\alpha$를 크게 잡으면(0.05) → 더 쉽게 귀무가설 기각 (민감)
  • $\alpha$를 작게 잡으면(0.01) → 더 보수적 판단 (엄격)
  • 상황에 따라 알맞은 $\alpha$를 설정해야 한다.