본문 바로가기

AI/확률|통계 기반

기술통계/추출법에 대해

1. 기술통계 (Descriptive Statistics)

기술통계는 데이터를 요약하고 정리하여 전체적인 특성을 파악하는 통계입니다. 추론통계(모집단을 추정하는 것)와 달리, 현재 가지고 있는 데이터를 설명하는 데 초점을 둡니다.

(1) 중심화 경향 (Measures of Central Tendency)

데이터가 어디쯤에 모여 있는지를 나타내는 값입니다.

통계량의미특징사용 상황
평균 (Mean) 모든 값을 더해 개수로 나눈 값 가장 많이 사용, 이상치에 민감 대칭 분포
중앙값 (Median) 정렬했을 때 가운데 값 이상치에 강함 비대칭 분포, 이상치 있을 때
최빈값 (Mode) 가장 자주 나타나는 값 범주형에도 사용 가능 가장 흔한 값 파악
 
 
  • 평균 = 중앙값 ≈ 최빈값 → 분포가 대칭에 가깝다
  • 평균 > 중앙값 → 오른쪽 꼬리가 긴 분포 (양의 왜도)

(2) 분산도 (Measures of Dispersion / Variability)

데이터가 중심에서 얼마나 퍼져 있는지를 나타냅니다.

통계량의미특징
범위 (Range) 최댓값 - 최솟값 계산 쉽지만 이상치에 매우 민감
분산 (Variance) 편차 제곱의 평균 단위가 제곱이 됨
표준편차 (Standard Deviation) 분산의 제곱근 원래 단위로 해석 가능, 가장 많이 사용
평균절대편차 (MAD) 절대편차의 평균 이상치에 덜 민감
사분위범위 (IQR) Q3 - Q1 이상치에 매우 강함, 박스플롯의 핵심
변동계수 (CV) (표준편차/평균) × 100% 단위가 다르거나 평균 크기가 다른 집단 비교 시 사용
 
 

(3) 자료 분포 형태 (Shape of Distribution)

측도의미해석
왜도 (Skewness) 좌우 비대칭 정도 >0 오른쪽 꼬리, <0 왼쪽 꼬리, =0 대칭
첨도 (Kurtosis) 꼬리의 두꺼운 정도와 뾰족한 정도 정규분포 기준 3 (초과첨도 0), >3이면 두꺼운 꼬리
 
 

분포 형태를 파악하면:

  • 정규분포에 가까운지
  • 변환(로그 등)이 필요한지
  • 이상치가 많은지 를 판단할 수 있습니다.

(4) 데이터 요약

기술통계의 핵심은 숫자를 통해 데이터를 한눈에 파악하는 것입니다.

대표적 요약 방법:

  • 5수 요약: 최솟값, Q1, 중앙값, Q3, 최댓값
  • 기술통계표: 평균, 표준편차, 왜도, 첨도, 개수 등
  • 시각화: 히스토그램, 박스플롯, 밀도곡선, Q-Q플롯

2. 모집단과 표본

개념정의기호 예시
모집단 (Population) 연구 대상이 되는 전체 집단 모평균 $  \mu  $, 모분산 $  \sigma^2  $
표본 (Sample) 모집단에서 일부를 추출한 것 표본평균 $  \bar{x}  $, 표본분산 $  s^2  $
 
 

우리는 보통 모집단 전체를 조사하기 어렵기 때문에, 표본을 추출 → 표본 통계량 계산 → 모집단을 추정하는 방식을 사용합니다.


3. 표본추출 (Sampling)

모집단에서 표본을 뽑는 방법입니다. 잘 뽑아야 표본이 모집단을 제대로 대표할 수 있습니다.

주요 표본추출 방법

확률표본추출 (Probability Sampling) – 추천

  • 단순무작위추출: 모든 개체가 뽑힐 확률이 동일
  • 계통추출: 일정 간격으로 추출 (예: 10번째마다)
  • 층화추출: 모집단을 층(성별, 연령 등)으로 나눈 뒤 각 층에서 추출 → 대표성 높음
  • 집락추출: 군집을 먼저 뽑고 그 안에서 조사 → 비용 절감

비확률표본추출 (Non-probability Sampling)

  • 편의추출, 판단추출, 할당추출, 눈덩이추출 등
  • 빠르고 저렴하지만 대표성이 떨어져 일반화에 한계

4. 조사 방법: 전수조사 vs 표본조사

구분전수조사 (Census)표본조사 (Sample Survey)
의미 모집단 전체를 조사 모집단 중 일부만 조사
장점 오차가 거의 없음, 완전한 정보 비용·시간·노력 절감, 빠른 결과
단점 비용과 시간이 매우 큼, 실무적으로 어려운 경우 많음 표본오차 발생, 표본이 편향되면 결과 왜곡
예시 인구주택총조사 여론조사, 시장조사, 대부분의 통계조사
 
 

전수조사를 하는 경우

  • 모집단 크기가 작을 때
  • 매우 정확한 값이 필요할 때
  • 법적·행정적으로 전체를 파악해야 할 때

표본조사를 하는 경우

  • 대부분의 실무·연구 상황
  • 비용과 시간을 합리적으로 쓰면서도 충분히 정확한 추정이 가능할 때

요약

  • 기술통계: 중심(평균·중앙값·최빈값) + 퍼짐(분산·표준편차·IQR) + 형태(왜도·첨도)로 데이터를 요약
  • 모집단은 전체, 표본은 그 일부
  • 표본추출을 잘해야 표본이 모집단을 대표함 (층화추출이 실무에서 자주 사용)
  • 전수조사는 전체를 다 조사, 표본조사는 일부를 뽑아 전체를 추정

이 개념들은 이후 추론통계(신뢰구간, 가설검정 등)의 기초가 됩니다.

 

 

1. 표본추출의 오차와 대표성 문제

표본을 뽑을 때 모집단을 제대로 반영하지 못하면 오차가 발생합니다.

개념의미결과
표본오차 (Sampling Error) 표본을 추출했기 때문에 발생하는 오차 표본 크기를 키우면 줄어듦
비표본오차 측정 오류, 무응답, 질문지 오류 등 표본 크기와 무관
과잉대표 (Over-representation) 특정 집단이 모집단 비율보다 더 많이 뽑힌 경우 그 집단의 특성이 과장됨
과소대표 (Under-representation) 특정 집단이 모집단 비율보다 뽑힌 경우 그 집단의 특성이 무시되거나 왜곡됨
 
 

예시 모집단 성별 비율이 남:여 = 5:5인데, 표본에서 남:여 = 7:3으로 뽑히면 남성은 과잉대표, 여성은 과소대표가 됩니다.

대표성이 깨지면 표본으로 모집단을 추정할 때 편향(Bias)이 발생합니다.


2. 확률 표본추출 기법

모든 개체가 표본으로 뽑힐 확률이 사전에 알려져 있는 추출 방법입니다. 통계적 추론이 가능해집니다.

(1) 단순무작위추출 (Simple Random Sampling, SRS)

  • 모집단의 모든 개체가 동일한 확률로 뽑힘
  • 복원추출 / 비복원추출 가능
  • 가장 기본적인 방법

장점: 이론적으로 단순하고 편향이 없음 단점: 모집단 명부가 필요, 표본이 한쪽으로 치우칠 가능성 있음, 비용이 클 수 있음

(2) 계통추출 (Systematic Sampling)

  • 모집단을 정렬한 뒤 일정 간격으로 추출
  • 예: 10명마다 1명씩 뽑기 (표본 간격 $  k = N/n  $)

장점: 단순무작위보다 실행이 간편, 모집단에 고르게 분포 단점: 모집단에 주기성이 있으면 편향 발생 가능 (예: 명부가 남녀남녀… 순서로 되어 있는데 짝수 간격으로 뽑으면 한쪽 성별만 뽑힘)

(3) 층화추출 (Stratified Sampling)

  • 모집단을 서로 비슷한 집단(층, Stratum)으로 나눈 뒤, 각 층에서 따로 표본을 추출하는 방법
  • 층의 동질성을 높이고, 층 간 이질성을 크게 만드는 것이 핵심

장점

  • 추정 정밀도가 높아짐
  • 과잉·과소대표 문제를 크게 줄일 수 있음
  • 층별 비교가 가능

단점

  • 층화변수를 잘 선택해야 함
  • 각 층의 모집단 크기 정보가 필요

3. 층화변수 (Stratification Variable)

층을 나누는 기준이 되는 변수입니다.

(1) 질적 층화변수 (Categorical / Qualitative)

  • 범주형 변수
  • 예: 성별, 지역, 학력, 직업, 소득구간(범주화한 경우)
  • 층을 명확하게 나눌 수 있음

(2) 양적 층화변수 (Quantitative)

  • 연속형·수치형 변수
  • 예: 나이, 소득, 매출액, 키, 점수
  • 보통 구간을 나누어 층으로 만듦 (예: 연령 20대/30대/40대…, 소득 하위/중위/상위)

좋은 층화변수의 조건

  • 조사 목적(관심 변수)과 상관이 높을수록 좋음
  • 층 내에서는 비슷하고, 층 간에는 차이가 커야 함
  • 각 층의 크기를 알 수 있어야 함

4. 층화추출에서 표본 배분 방법

전체 표본 크기 $  n  $을 각 층에 어떻게 나눌 것인가의 문제입니다.
층 개수를 $  H  $, $  h  $번째 층의 모집단 크기를 $  N_h  $, 표본 크기를 $  n_h  $라고 합니다.

(1) 비례배분 (Proportional Allocation)

$n_h = n \times \frac{N_h}{N}$

 

  • 각 층의 모집단 크기 비율대로 표본을 배분
  • 가장 흔하고 직관적인 방법
  • 층별 크기가 다를 때 과잉·과소대표를 방지

예시 전체 1000명 중 A층 600명, B층 400명 → 표본 100명을 뽑을 때 A층 60명, B층 40명

(2) 네이만 배분 (Neyman Allocation)

$n_h = n \times \frac{N_h \sigma_h}{\sum N_h \sigma_h}$

 

  • 층의 크기($  N_h  $)와 층의 표준편차($  \sigma_h  $)를 동시에 고려
  • 변동이 큰 층에 더 많은 표본을 배분
  • 전체 추정치의 분산을 최소화하는 데 초점

특징

  • 비례배분보다 통계적으로 더 효율적
  • 각 층의 표준편차 정보가 필요

(3) 최적 배분 (Optimal Allocation)

$n_h = n \times \frac{N_h \sigma_h / \sqrt{c_h}}{\sum (N_h \sigma_h / \sqrt{c_h})}$

 

  • 층의 크기, 표준편차뿐만 아니라 조사 비용($  c_h  $)까지 고려
  • 비용이 많이 드는 층에는 표본을 적게, 적게 드는 층에는 더 많이 배분
  • 주어진 비용 안에서 추정의 精度를 가장 높이는 방법

정리

배분 방법고려 요소특징
비례배분 층 크기만 가장 단순, 실무에서 많이 사용
네이만 배분 층 크기 + 표준편차 통계적 효율 최대화
최적 배분 층 크기 + 표준편차 + 비용 비용까지 고려한 가장 효율적인 배분
 
 

요약

  • 과잉대표/과소대표는 표본이 모집단 비율을 제대로 반영하지 못할 때 발생 → 편향의 원인
  • 단순무작위는 기본, 계통추출은 간편, 층화추출은 정확도와 대표성을 높이는 방법
  • 층화변수는 질적(범주형)과 양적(수치형)으로 나뉘며, 관심 변수와 관련이 큰 것을 선택
  • 표본 배분은
    • 비례배분 → 크기 기준
    • 네이만 배분 → 크기 + 변동
    • 최적 배분 → 크기 + 변동 + 비용

실무에서는 층화추출 + 비례배분 조합을 가장 많이 사용합니다.

 

 

 

비확률 표본추출 기법

비확률 표본추출은 모집단의 각 개체가 표본으로 뽑힐 확률이 사전에 알려지지 않거나 동일하지 않은 방법입니다. 통계적 추론(오차 계산, 신뢰구간 등)이 제한적이지만, 실무에서 시간과 비용 때문에 자주 사용됩니다.


1. 간편추출법 (Convenience Sampling, 편의추출)

정의 연구자가 쉽게 접할 수 있는 대상을 그냥 표본으로 뽑는 방법입니다.

예시

  • 길거리에서 지나가는 사람을 인터뷰
  • 학교 앞 학생들에게 설문
  • 온라인 커뮤니티에 설문 링크를 올려 응답한 사람만 조사
  • 자신의 주변 지인에게 조사

장점

  • 가장 빠르고 저렴
  • 실행이 매우 간편

단점

  • 대표성이 매우 낮음
  • 특정 성향의 사람들만 과잉대표될 가능성이 큼
  • 결과를 모집단으로 일반화하기 어려움

사용 시기 예비조사(파일럿), 탐색적 연구, 시간이 매우 부족할 때


2. 판단추출법 (Judgmental / Purposive Sampling)

정의 연구자의 전문적인 판단으로 “이 사람이 적합하다”고 생각되는 대상을 의도적으로 뽑는 방법입니다.

예시

  • 전문가 의견이 필요할 때 해당 분야 권위자만 선정
  • 특정 경험을 가진 사람만 인터뷰 (예: 최근 1년 내 이직자)
  • 전형적인 사례나 극단적인 사례를 의도적으로 선택

장점

  • 연구 목적에 맞는 사람을 직접 고를 수 있음
  • 질적 연구에서 특히 유용
  • 소수의 깊이 있는 정보를 얻기 좋음

단점

  • 연구자의 주관이 크게 개입 → 편향 가능성
  • 다른 연구자가 재현하기 어려움
  • 일반화에 한계

사용 시기 전문가 조사, 사례 연구, 특정 특성을 가진 집단을 깊이 탐구할 때


3. 할당추출법 (Quota Sampling)

정의 모집단의 특정 특성(성별, 연령, 지역 등) 비율에 맞춰 할당량(Quota)을 정해놓고, 그 할당량을 채울 때까지 간편추출이나 판단추출로 대상을 모으는 방법입니다.

예시 전체 표본 200명 중

  • 남성 100명, 여성 100명
  • 20대 50명, 30대 50명, 40대 50명, 50대 이상 50명 이렇게 할당량을 정한 뒤, 길거리나 온라인에서 해당 조건에 맞는 사람을 채움

장점

  • 주요 인구통계 비율을 어느 정도 맞출 수 있음
  • 단순 간편추출보다 대표성이 나음
  • 비용과 시간이 확률추출보다 적게 듦

단점

  • 할당량 안에서는 여전히 편의적으로 뽑기 때문에 편향이 남음
  • 할당 기준 외의 변수에서는 대표성을 보장하지 못함
  • 확률추출이 아니므로 표본오차를 정확히 계산하기 어려움

사용 시기 여론조사, 시장조사에서 시간과 비용 제약으로 확률추출이 어려울 때 (실무에서 가장 흔히 사용되는 비확률 추출법 중 하나)


4. 눈덩이추출법 (Snowball Sampling)

정의 처음 선정한 소수의 응답자에게 “당신과 비슷한 사람을 소개해 달라”고 요청해서 표본을 눈덩이처럼 불려가는 방법입니다.

예시

  • 희귀 질환자 조사: 환자 한 명에게 다른 환자를 소개받음
  • 특정 직업·취미 집단 (예: 프로 게이머, 특정 종교 집단)
  • 숨겨진 인구(Hidden Population): 마약 사용자, 불법 체류자 등

장점

  • 명부가 없거나 접근이 어려운 집단을 조사할 수 있음
  • 네트워크를 통해 자연스럽게 표본 확보

단점

  • 처음 시작한 사람의 인맥에 크게 의존 → 편향 가능성 큼
  • 비슷한 사람들끼리만 연결되어 다양성이 떨어질 수 있음
  • 일반화에 매우 취약

사용 시기 희귀 집단, 접근이 어려운 집단, 사회적 연결망이 중요한 연구


비교 요약

방법핵심 아이디어대표성실행 용이성주요 사용
간편추출 쉽게 구할 수 있는 사람 매우 낮음 가장 쉬움 예비조사
판단추출 연구자가 적합하다고 판단한 사람 낮음 쉬움 전문가·사례 연구
할당추출 특성 비율에 맞춰 할당량 채우기 중간 보통 여론·시장조사
눈덩이추출 소개를 통해 표본 확대 낮음 조건부로 쉬움 희귀·숨겨진 집단
 

핵심 정리

비확률 표본추출은 확률을 알 수 없기 때문에 통계적 추정에 한계가 있습니다. 그러나 실무에서는 비용·시간·접근성 때문에 자주 사용되며, 특히 할당추출은 비율을 어느 정도 맞출 수 있어 가장 현실적인 대안으로 많이 쓰입니다.

연구 결과의 일반화 범위를 명확히 제한하고, 편향 가능성을 인정하는 것이 중요합니다.

'AI > 확률|통계 기반' 카테고리의 다른 글

이산확률분포의 모든 것에 대해  (0) 2026.08.08
확률분포의 전반에 대해  (0) 2026.08.08
비정형 데이터 탐색  (0) 2026.08.08
다변량 데이터 탐색  (1) 2026.08.08
고급데이터 탐색  (0) 2026.08.08