이산확률분포는 확률변수가 셀 수 있는 값만 가질 때의 분포입니다. 아래에 주요 분포를 정의·조건·확률질량함수·기댓값·분산·예시 계산까지 구체적으로 설명합니다.
1. 베르누이 분포 (Bernoulli Distribution)
정의 성공(1) 또는 실패(0) 두 가지 결과만 있는 한 번의 시행.
조건
- 시행 횟수 = 1
- 성공 확률 $ p $, 실패 확률 $ 1-p $
확률질량함수
기댓값과 분산
예시 불량률이 5%인 공정에서 제품 1개를 검사할 때 불량일 확률
→ $ X \sim \text{Bernoulli}(0.05) $
$ P(X=1) = 0.05 $
2. 이항분포 (Binomial Distribution)
정의 베르누이 시행을 독립적으로 n번 반복할 때, 성공 횟수의 분포.
조건
- 각 시행은 성공/실패 두 가지
- 성공 확률 $ p $가 모든 시행에서 동일
- 시행이 서로 독립
- 시행 횟수 $ n $이 고정
확률질량함수
기댓값과 분산
예시 계산 주사위를 10번 던져서 6이 나오는 횟수 $ X $
$ X \sim B(n=10, p=1/6) $
6이 정확히 2번 나올 확률:
= 45 \times \frac{1}{36} \times \left(\frac{5}{6}\right)^8 \approx 0.2907$
기댓값: $ E(X) = 10 \times \frac{1}{6} \approx 1.667 $
3. 다항분포 (Multinomial Distribution)
정의 한 번의 시행에서 결과가 3개 이상이고, 이를 n번 독립 반복할 때 각 결과가 나타나는 횟수의 결합분포.
조건
- 각 시행의 결과가 $ k $가지 ($ k \geq 3 $)
- 각 결과 확률 $ p_1, p_2, \dots, p_k $ ($ \sum p_i = 1 $)
- n번 독립 반복
확률질량함수
$P(X_1=n_1, \dots, X_k=n_k) = \frac{n!}{n_1! n_2! \cdots n_k!} p_1^{n_1} p_2^{n_2} \cdots p_k^{n_k}$
단, $ n_1+n_2+\cdots+n_k = n $
기댓값과 분산
$$Cov(X_i, X_j) = -np_i p_j \quad (i \neq j)$$
예시 주사위를 12번 던져서 1이 2번, 2가 3번, 3이 1번, 4가 2번, 5가 2번, 6이 2번 나올 확률 (각 눈 확률 1/6)
4. 포아송 분포 (Poisson Distribution)
정의 단위 시간/공간당 사건 발생 횟수의 분포. 드물게 일어나는 사건의 횟수에 주로 사용.
조건 및 유도
- 이항분포에서 $ n \to \infty $, $ p \to 0 $, $ np = \lambda $로 고정될 때의 극한
- 사건이 독립적으로 발생
- 평균 발생률 $ \lambda $가 일정
확률질량함수
기댓값과 분산
(평균과 분산이 같다는 특징)
예시 계산 mon 평균 3통의 스팸 메일이 올 때, 오늘 스팸이 정확히 2통 올 확률$ X \sim \text{Poisson}(\lambda=3) $
$$P(X=2) = \frac{e^{-3} \cdot 3^2}{2!} = \frac{e^{-3} \cdot 9}{2} \approx 0.2240$$
하루 동안 스팸이 하나도 안 올 확률:
5. 기하분포 (Geometric Distribution)
정의 성공 확률이 p p 인 베르누이 시행을 반복할 때, 첫 번째 성공이 나올 때까지의 시행 횟수 (또는 실패 횟수).
두 가지 정의
- $ X $: 첫 성공까지의 시행 횟수 (지원: 1,2,3,…)
- $ Y $: 첫 성공 전까지의 실패 횟수 (지원: 0,1,2,…)
확률질량함수 (시행 횟수 기준)
기댓값과 분산
$E(X) = \frac{1}{p}, \quad Var(X) = \frac{1-p}{p^2}$
예시 계산 어떤 야구선수의 안타 확률이 0.3일 때, 첫 안타가 5번째 타석에서 나올 확률
기댓값: 평균적으로 $ 1/0.3 \approx 3.33 $타석만에 안타
무기억성 (Memorylessness)
이미 s번 실패했어도, 앞으로의 대기 시간은 처음과 동일.
6. 초기하분포 (Hypergeometric Distribution)
정의 유한 모집단에서 비복원추출할 때, 성공 개수의 분포.
조건
- 모집단 크기 $ N $
- 모집단 내 성공 개수 $ K $
- 표본 크기 $ n $
- 비복원 추출
확률질량함수
$P(X=k) = \frac{\binom{K}{k} \binom{N-K}{n-k}}{\binom{N}{n}}$
단, $ \max(0, n-(N-K)) \leq k \leq \min(n,K) $
기댓값과 분산
$E(X) = n \cdot \frac{K}{N}$
$Var(X) = n \cdot \frac{K}{N} \cdot \frac{N-K}{N} \cdot \frac{N-n}{N-1}$
(마지막 항 $ \frac{N-n}{N-1} $이 유한모집단 수정계수)
예시 계산 50개 제품 중 불량품이 5개 있을 때, 10개를 비복원으로 뽑아서 불량품이 정확히 2개 포함될 확률
$$P(X=2) = \frac{\binom{5}{2} \binom{45}{8}}{\binom{50}{10}}$$
계산하면 약 0.2098
7. 기타 주요 이산분포
음이항분포 (Negative Binomial)
- 성공이 r번 나올 때까지의 시행 횟수
- 기하분포는 r=1인 특수 경우
$E(X) = \frac{r}{p}, \quad Var(X) = \frac{r(1-p)}{p^2}$
이산균등분포 (Discrete Uniform)
- $ \{1,2,\dots,N\} $ 중 하나가 동일한 확률로 선택
$P(X=x) = \frac{1}{N}, \quad E(X) = \frac{N+1}{2}, \quad Var(X) = \frac{N^2-1}{12}$
8. 분포 간 관계 요약
| 베르누이 | 1회 성공/실패 | p p | p(1−p) p(1-p) |
| 이항 | n회 중 성공 횟수 | np np | np(1−p) np(1-p) |
| 다항 | n회 중 여러 결과 횟수 | npi np_i | npi(1−pi) np_i(1-p_i) |
| 포아송 | 단위당 발생 횟수 | λ \lambda | λ \lambda |
| 기하 | 첫 성공까지 횟수 | 1/p 1/p | (1−p)/p2 (1-p)/p^2 |
| 초기하 | 비복원 추출 성공 개수 | nK/N nK/N | 수정계수 포함 |
| 음이항 | r번 성공까지 횟수 | r/p r/p | r(1−p)/p2 r(1-p)/p^2 |
극한 관계
- 이항분포 → 포아송분포 ($ n $ 크고 $ p $ 작을 때)
- 초기하분포 → 이항분포 ($ N $이 매우 클 때, 비복원≈복원)
'AI > 확률|통계 기반' 카테고리의 다른 글
| 연속확률분포 주요 종류 정리 (0) | 2026.08.09 |
|---|---|
| 확률분포의 전반에 대해 (0) | 2026.08.08 |
| 기술통계/추출법에 대해 (0) | 2026.08.08 |
| 비정형 데이터 탐색 (0) | 2026.08.08 |
| 다변량 데이터 탐색 (1) | 2026.08.08 |