본문 바로가기

AI/확률|통계 기반

이산확률분포의 모든 것에 대해

이산확률분포는 확률변수가 셀 수 있는 값만 가질 때의 분포입니다. 아래에 주요 분포를 정의·조건·확률질량함수·기댓값·분산·예시 계산까지 구체적으로 설명합니다.


1. 베르누이 분포 (Bernoulli Distribution)

정의 성공(1) 또는 실패(0) 두 가지 결과만 있는 한 번의 시행.

조건

  • 시행 횟수 = 1
  • 성공 확률 $  p  $, 실패 확률 $  1-p  $

확률질량함수

$P(X=x) = p^x (1-p)^{1-x}, \quad x=0,1$

 

기댓값과 분산

$E(X) = p, \quad Var(X) = p(1-p)$

 

예시 불량률이 5%인 공정에서 제품 1개를 검사할 때 불량일 확률
→ $  X \sim \text{Bernoulli}(0.05)  $
$  P(X=1) = 0.05  $


2. 이항분포 (Binomial Distribution)

정의 베르누이 시행을 독립적으로 n번 반복할 때, 성공 횟수의 분포.

조건

  • 각 시행은 성공/실패 두 가지
  • 성공 확률 $  p  $가 모든 시행에서 동일
  • 시행이 서로 독립
  • 시행 횟수 $  n  $이 고정

확률질량함수

$P(X=k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k=0,1,2,\dots,n$

 

기댓값과 분산

$E(X) = np, \quad Var(X) = np(1-p)$

 

예시 계산 주사위를 10번 던져서 6이 나오는 횟수 $  X  $
$  X \sim B(n=10, p=1/6)  $

6이 정확히 2번 나올 확률:

$P(X=2) = \binom{10}{2} \left(\frac{1}{6}\right)^2 \left(\frac{5}{6}\right)^8
= 45 \times \frac{1}{36} \times \left(\frac{5}{6}\right)^8 \approx 0.2907$

 

 

기댓값: $  E(X) = 10 \times \frac{1}{6} \approx 1.667  $


3. 다항분포 (Multinomial Distribution)

정의 한 번의 시행에서 결과가 3개 이상이고, 이를 n번 독립 반복할 때 각 결과가 나타나는 횟수의 결합분포.

조건

  • 각 시행의 결과가 $  k  $가지 ($  k \geq 3  $)
  • 각 결과 확률 $  p_1, p_2, \dots, p_k  $ ($  \sum p_i = 1  $)
  • n번 독립 반복

확률질량함수

 

$P(X_1=n_1, \dots, X_k=n_k) = \frac{n!}{n_1! n_2! \cdots n_k!} p_1^{n_1} p_2^{n_2} \cdots p_k^{n_k}$

단, $  n_1+n_2+\cdots+n_k = n  $

 

기댓값과 분산

$$E(X_i) = np_i, \quad Var(X_i) = np_i(1-p_i)$$
$$Cov(X_i, X_j) = -np_i p_j \quad (i \neq j)$$

 

 

예시 주사위를 12번 던져서 1이 2번, 2가 3번, 3이 1번, 4가 2번, 5가 2번, 6이 2번 나올 확률 (각 눈 확률 1/6)

$P = \frac{12!}{2!3!1!2!2!2!} \left(\frac{1}{6}\right)^{12}$

 


4. 포아송 분포 (Poisson Distribution)

정의 단위 시간/공간당 사건 발생 횟수의 분포. 드물게 일어나는 사건의 횟수에 주로 사용.

조건 및 유도

  • 이항분포에서 $  n \to \infty  $, $  p \to 0  $, $  np = \lambda  $로 고정될 때의 극한
  • 사건이 독립적으로 발생
  • 평균 발생률 $  \lambda  $가 일정

확률질량함수

$P(X=k) = \frac{e^{-\lambda} \lambda^k}{k!}, \quad k=0,1,2,\dots$

 

기댓값과 분산

$E(X) = \lambda, \quad Var(X) = \lambda$

 

(평균과 분산이 같다는 특징)

예시 계산 mon 평균 3통의 스팸 메일이 올 때, 오늘 스팸이 정확히 2통 올 확률$  X \sim \text{Poisson}(\lambda=3)  $
$$P(X=2) = \frac{e^{-3} \cdot 3^2}{2!} = \frac{e^{-3} \cdot 9}{2} \approx 0.2240$$

 

하루 동안 스팸이 하나도 안 올 확률:

$P(X=0) = e^{-3} \approx 0.0498$

 


5. 기하분포 (Geometric Distribution)

정의 성공 확률이 p p 인 베르누이 시행을 반복할 때, 첫 번째 성공이 나올 때까지의 시행 횟수 (또는 실패 횟수).

두 가지 정의

  • $  X  $: 첫 성공까지의 시행 횟수 (지원: 1,2,3,…)
  • $  Y  $: 첫 성공 전까지의 실패 횟수 (지원: 0,1,2,…)

확률질량함수 (시행 횟수 기준)

$P(X=k) = (1-p)^{k-1} p, \quad k=1,2,3,\dots$

 

기댓값과 분산

$E(X) = \frac{1}{p}, \quad Var(X) = \frac{1-p}{p^2}$

 

 

예시 계산 어떤 야구선수의 안타 확률이 0.3일 때, 첫 안타가 5번째 타석에서 나올 확률

$P(X=5) = (0.7)^4 \times 0.3 \approx 0.07203$

 

기댓값: 평균적으로 $  1/0.3 \approx 3.33  $타석만에 안타

무기억성 (Memorylessness)

$P(X > s+t \mid X > s) = P(X > t)$

 

이미 s번 실패했어도, 앞으로의 대기 시간은 처음과 동일.


6. 초기하분포 (Hypergeometric Distribution)

정의 유한 모집단에서 비복원추출할 때, 성공 개수의 분포.

조건

  • 모집단 크기 $  N  $
  • 모집단 내 성공 개수 $  K  $
  • 표본 크기 $  n  $
  • 비복원 추출

확률질량함수

$P(X=k) = \frac{\binom{K}{k} \binom{N-K}{n-k}}{\binom{N}{n}}$

 

단, $  \max(0, n-(N-K)) \leq k \leq \min(n,K)  $

기댓값과 분산

$E(X) = n \cdot \frac{K}{N}$

 

$Var(X) = n \cdot \frac{K}{N} \cdot \frac{N-K}{N} \cdot \frac{N-n}{N-1}$

 

(마지막 항 $  \frac{N-n}{N-1}  $이 유한모집단 수정계수)

예시 계산 50개 제품 중 불량품이 5개 있을 때, 10개를 비복원으로 뽑아서 불량품이 정확히 2개 포함될 확률

$$P(X=2) = \frac{\binom{5}{2} \binom{45}{8}}{\binom{50}{10}}$$

 

 

계산하면 약 0.2098


7. 기타 주요 이산분포

음이항분포 (Negative Binomial)

  • 성공이 r번 나올 때까지의 시행 횟수
  • 기하분포는 r=1인 특수 경우
$P(X=k) = \binom{k-1}{r-1} p^r (1-p)^{k-r}, \quad k=r,r+1,\dots$

 

 

$E(X) = \frac{r}{p}, \quad Var(X) = \frac{r(1-p)}{p^2}$

 

이산균등분포 (Discrete Uniform)

  • $  \{1,2,\dots,N\}  $ 중 하나가 동일한 확률로 선택

$P(X=x) = \frac{1}{N}, \quad E(X) = \frac{N+1}{2}, \quad Var(X) = \frac{N^2-1}{12}$


8. 분포 간 관계 요약

분포핵심 상황기댓값분산
베르누이 1회 성공/실패 p p p(1−p) p(1-p)
이항 n회 중 성공 횟수 np np np(1−p) np(1-p)
다항 n회 중 여러 결과 횟수 npi np_i npi(1−pi) np_i(1-p_i)
포아송 단위당 발생 횟수 λ \lambda λ \lambda
기하 첫 성공까지 횟수 1/p 1/p (1−p)/p2 (1-p)/p^2
초기하 비복원 추출 성공 개수 nK/N nK/N 수정계수 포함
음이항 r번 성공까지 횟수 r/p r/p r(1−p)/p2 r(1-p)/p^2
 
 

극한 관계

  • 이항분포 → 포아송분포 ($  n  $ 크고 $  p  $ 작을 때)
  • 초기하분포 → 이항분포 ($  N  $이 매우 클 때, 비복원≈복원)

'AI > 확률|통계 기반' 카테고리의 다른 글

연속확률분포 주요 종류 정리  (0) 2026.08.09
확률분포의 전반에 대해  (0) 2026.08.08
기술통계/추출법에 대해  (0) 2026.08.08
비정형 데이터 탐색  (0) 2026.08.08
다변량 데이터 탐색  (1) 2026.08.08