확률 전반 + 기술통계·추론통계 + 경우의 수·순열·조합
1. 기술통계와 추론통계
| 목적 | 가지고 있는 데이터를 요약·정리 | 표본으로 모집단을 추정·검정 |
| 질문 | “데이터가 어떻게 생겼는가?” | “이 결과가 모집단에서도 그럴까?” |
| 주요 내용 | 평균, 중앙값, 분산, 표준편차, 그래프 | 신뢰구간, 가설검정, 회귀분석 등 |
| 확률 사용 | 거의 사용하지 않음 | 확률을 기반으로 결론을 내림 |
추론통계를 하려면 확률 개념이 반드시 필요합니다.
2. 확률의 개념
확률(Probability)이란 어떤 사건이 일어날 가능성의 정도를 0과 1 사이의 숫자로 나타낸 것입니다.
- 0에 가까울수록 → 거의 일어나지 않음
- 1에 가까울수록 → 거의 확실히 일어남
- 0.5 → 일어날 가능성과 일어나지 않을 가능성이 비슷함
확률의 세 가지 접근
- 고전적 확률 모든 결과가 동등하게 일어날 때
-
- 상대빈도 확률 실험을 많이 반복했을 때 그 사건이 나타난 비율
- 주관적 확률 개인의 믿음이나 경험에 기초한 확률 (예: “내일 비가 올 확률 70%”)
3. 경우의 수
어떤 시행에서 나타날 수 있는 모든 가능한 결과의 개수입니다.
기본 법칙
- 합의 법칙: 두 사건이 서로 배반일 때 (동시에 일어날 수 없을 때) $ n(A \cup B) = n(A) + n(B) $
- 곱의 법칙: 두 사건이 차례로 일어날 때 $ n(A \text{ 그리고 } B) = n(A) \times n(B) $
예시 주사위 하나와 동전 하나를 동시에 던질 때 전체 경우의 수 = 6 × 2 = 12가지
4. 순열 (Permutation)
순서가 다를 때 다른 것으로 보는 경우의 수입니다. “배열”, “순서”가 중요할 때 사용합니다.
공식
- 서로 다른 n개 중 r개를 순서 있게 뽑는 경우
$P(n, r) = {}_nP_r = \frac{n!}{(n-r)!}$
- n개 전체를 나열하는 경우
- 같은 것이 있는 경우 (예: 같은 글자가 있는 단어)
$\frac{n!}{n_1! \times n_2! \times \cdots}$
예시
- 5명 중 3명을 뽑아 대통령, 부통령, 서기를 선출하는 경우의 수 → 순서가 다르면 다른 결과가 되므로 순열
${}_5P_3 = 5 \times 4 \times 3 = 60$
- “BOOK”이라는 단어를 나열하는 경우의 수
$\frac{4!}{2!} = 12$(O가 2개라서 2!로 나눔)
5. 조합 (Combination)
순서가 달라도 같은 것으로 보는 경우의 수입니다. “선택”, “조합”만 중요하고 순서는 상관없을 때 사용합니다.
공식
$C(n, r) = {}_nC_r = \binom{n}{r} = \frac{n!}{r!(n-r)!} = \frac{{}_nP_r}{r!}$
예시
- 5명 중 3명을 단순 위원으로 뽑는 경우의 수 → 누가 뽑히느냐만 중요하고 순서는 상관없으므로 조합
${}_5C_3 = \frac{5 \times 4 \times 3}{3 \times 2 \times 1} = 10$
- 로또 6/45 : 45개 중 6개를 뽑는 경우의 수
${}_{45}C_6 = 8,145,060$
6. 순열과 조합 비교
| 순서 | 중요함 (다르면 다른 것) | 중요하지 않음 |
| 의미 | 배열, 줄 세우기 | 선택, 뽑기 |
| 공식 | ||
| 예시 | 1등, 2등, 3등 선정 | 그냥 3명 선정 |
핵심 차이 같은 사람들이라도
- “A가 1등, B가 2등”과 “B가 1등, A가 2등”을 다르게 보면 → 순열
- 같은 것으로 보면 → 조합
7. 전체 흐름 요약
- 기술통계: 데이터를 요약하는 것
- 추론통계: 표본으로 모집단을 판단하는 것 → 확률 필요
- 확률: 사건이 일어날 가능성을 숫자로 표현
- 경우의 수: 확률을 계산하는 기본 재료
- 순열: 순서가 중요할 때
- 조합: 순서 없이 선택만 할 때
확률 개념 전반 정리
1. 확률이란?
어떤 사건이 일어날 가능성의 정도를 0과 1 사이의 숫자로 나타낸 것입니다.
- $ P(A) = 0 $: 절대 일어나지 않음
- $ P(A) = 1 $: 반드시 일어남
- $ 0 < P(A) < 1 $: 일어날 수도, 안 일어날 수도 있음
2. 통계적 확률 (경험적 확률)
실험을 매우 많이 반복했을 때, 어떤 사건이 나타나는 상대적 비율로 확률을 정의하는 방식입니다.
$P(A) = \lim_{n \to \infty} \frac{\text{사건 A가 일어난 횟수}}{n}$
- 고전적 확률: 이론적으로 모든 결과가 동등하다고 가정
- 통계적 확률: 실제 데이터를 바탕으로 계산 (예: 동전을 1만 번 던져서 앞면이 나온 비율)
3. 표본공간과 사건
(1) 표본공간 (Sample Space, $ S $ 또는 $ \Omega $)
어떤 시행에서 나타날 수 있는 모든 가능한 결과의 집합입니다.
예시:
- 동전 1개: $ S = \{H, T\} $
- 주사위 1개: $ S = \{1,2,3,4,5,6\} $
- 동전 2개: $ S = \{HH, HT, TH, TT\} $
(2) 사건 (Event)
표본공간의 부분집합입니다. 우리가 관심을 갖는 결과들의 모음입니다.
예시 (주사위):
- 건 A: 짝수가 나오는 경우 → $ A = \{2,4,6\} $
- 사건 B: 3 이상이 나오는 경우 → $ B = \{3,4,5,6\} $
4. 확률의 기본 성질
- 비음성: 모든 사건 A에 대해 $ P(A) \geq 0 $
- 정규성: 전체 표본공간의 확률은 1
$ P(S) = 1 $ - 가산성: 서로 배반인 사건(동시에 일어날 수 없는 사건) $ A_1, A_2, \dots $에 대해
$$P(A_1 \cup A_2 \cup \cdots) = P(A_1) + P(A_2) + \cdots$$
추가 성질
- $ P(\emptyset) = 0 $
- $ P(A^c) = 1 - P(A) $ (여사건의 확률)
- $ P(A \cup B) = P(A) + P(B) - P(A \cap B) $
- $ A \subset B $이면 $ P(A) \leq P(B) $
5. 결합확률 (Joint Probability)
두 사건 A와 B가 동시에 일어날 확률입니다.
예시: 주사위를 던질 때
6. 조건부 확률 (Conditional Probability)
사건 B가 이미 일어났다는 조건 하에서 사건 A가 일어날 확률입니다.
의미: “B가 발생했다는 정보를 알게 된 후” A의 확률
예시: 주사위에서 짝수가 나왔다는 걸 알았을 때, 그것이 4 이상일 확률
$P(B|A) = \frac{P(\{4,6\})}{P(\{2,4,6\})} = \frac{2/6}{3/6} = \frac{2}{3}$
곱셈법칙
7. 총확률 정리 (Law of Total Probability)
사건 A의 확률을 분할된 여러 경로를 통해 계산하는 방법입니다.
사건 $ B_1, B_2, \dots, B_n $이 서로 배반이고 전체 표본공간을 이룰 때:
직관: A가 일어나는 모든 가능한 원인을 다 더하는 것
예시: 공장 3곳에서 제품을 생산
- 1공장: 전체의 50%, 불량률 2%
- 2공장: 30%, 불량률 3%
- 3공장: 20%, 불량률 5%
전체 불량률:
8. 베이즈 정리 (Bayes’ Theorem)
결과를 보고 원인의 확률을 거꾸로 추론하는 공식입니다.
$P(B_i|A) = \frac{P(A|B_i) P(B_i)}{P(A)} = \frac{P(A|B_i) P(B_i)}{\sum_{j} P(A|B_j) P(B_j)}$
- $ P(B_i) $: 사전확률 (Prior)
- $ P(A|B_i) $: 우도 (Likelihood)
- $ P(B_i|A) $: 사후확률 (Posterior)
예시 (위에서 이어서) 불량품이 나왔을 때, 그것이 3공장에서 왔을 확률은?
약 34.5%입니다.
9. 전체 구조 한눈에 보기
표본공간 (S)
└── 사건 (A, B, ...)
├── 결합확률 P(A ∩ B)
├── 조건부 확률 P(A|B)
├── 총확률 정리 P(A) = Σ P(A|Bi)P(Bi)
└── 베이즈 정리 P(Bi|A) = ...
- 결합확률: 동시에 일어날 확률
- 조건부 확률: 한쪽이 일어난 조건에서 다른 쪽 확률
- 총확률 정리: 여러 경로를 통해 전체 확률 계산
- 베이즈 정리: 결과를 보고 원인의 확률을 업데이트
이 개념들은 머신러닝(나이브 베이즈 분류기 등), 의료 진단, 스팸 필터, 위험 분석 등 다양한 분야에서 핵심적으로 사용됩니다.
확률변수와 확률분포, 기댓값·분산
1. 확률변수 (Random Variable)
확률변수란 표본공간의 각 결과에 숫자를 대응시킨 함수입니다. 즉, 우연히 결정되는 수치적 결과를 나타냅니다.
예시:
- 주사위를 던져 나온 눈의 수 → $ X $
- 동전을 10번 던져 앞면이 나온 횟수 → $ X $
- 내일 주식 수익률 → $ X $
확률변수를 쓰는 이유: 사건의 결과를 숫자로 바꿔서 수학적으로 다루기 쉽게 만들기 위함입니다.
2. 확률변수의 종류
| 이산확률변수 (Discrete) | 가질 수 있는 값이 셀 수 있는 경우 | 주사위 눈, 불량품 개수, 앞면이 나온 횟수 |
| 연속확률변수 (Continuous) | 어떤 구간의 모든 실수 값을 가질 수 있는 경우 | 키, 몸무게, 온도, 대기 시간 |
- 이산: 1, 2, 3, …처럼 뚝뚝 끊어짐
- 연속: 170.1cm, 170.11cm처럼 연속적으로 이어짐
3. 확률분포 (Probability Distribution)
확률변수가 어떤 값을 가질 확률을 정리해 놓은 것입니다. “확률변수의 확률 법칙”이라고 생각하면 됩니다.
- 이산확률변수 → 이산확률분포
- 연속확률변수 → 연속확률분포
4. 확률분포의 함수
(1) 이산확률분포함수 (확률질량함수, PMF)
이산확률변수 $ X $가 특정 값 $ x $를 가질 확률을 나타내는 함수입니다.
성질
- $ p(x) \geq 0 $
- $ \sum_{x} p(x) = 1 $
예시 (공정한 주사위):
(2) 연속확률분포함수 (확률밀도함수, PDF)
연속확률변수에서는 특정 한 점의 확률이 0이므로, 구간의 확률을 밀도함수의 적분으로 나타냅니다.
성질
- $ f(x) \geq 0 $
- $ \int_{-\infty}^{\infty} f(x)\, dx = 1 $
- 특정 점의 확률: $ P(X = a) = 0 $
누적분포함수 (CDF) 이산·연속 모두에서 사용하는 공통 개념:
5. 확률변수의 기댓값 (Expected Value)
기댓값은 확률변수의 중심(평균)을 나타내는 값입니다. “확률적으로 평균적으로 기대되는 값”입니다.
(1) 이산확률변수
(2) 연속확률변수
예시 (주사위)
기댓값의 성질
- $ E(aX + b) = aE(X) + b $
- $ E(X + Y) = E(X) + E(Y) $ (항상 성립)
6. 확률변수의 분산 (Variance)
분산은 확률변수가 기댓값으로부터 얼마나 퍼져 있는지를 나타냅니다.
(1) 이산
(2) 연속
표준편차
$\sigma = \sqrt{Var(X)}$
분산의 성질
- $ Var(aX + b) = a^2 Var(X) $
- $ X $와 $ Y $가 독립이면 $ Var(X+Y) = Var(X) + Var(Y) $
7. 한눈에 정리
| 값의 형태 | 셀 수 있는 값 | 연속적인 실수 값 |
| 확률 함수 | 확률질량함수$ p(x) = P(X=x) $ | 확률밀도함수 $ f(x) $ |
| 확률 계산 | 합 ($ \sum $) | 적분 ($ \int $) |
| 기댓값 | $ \sum x p(x) $ | $ \int x f(x) dx $ |
| 분산 | $ \sum (x-\mu)^2 p(x) $ | $ \int (x-\mu)^2 f(x) dx $ |
핵심 요약
- 확률변수: 우연한 결과에 숫자를 부여한 것
- 이산 vs 연속: 값이 뚝뚝 끊기느냐, 연속적으로 이어지느냐
- 확률분포: 확률변수가 어떤 값을 가질 확률을 정리한 것
- PMF: 이산변수에서 “그 값이 될 확률”
- PDF: 연속변수에서 “구간의 확률을 구하기 위한 밀도”
- 기댓값: 확률적 평균
- 분산: 기댓값으로부터의 평균적인 퍼짐 정도
1. 기댓값의 성질
기댓값을 $ E(X) $ 또는 $ \mu $로 나타냅니다.
기본 성질
- 상수
$E(c) = c$
- 상수배
$E(aX) = a E(X)$
- 선형
$E(aX + b) = a E(X) + b$
덧셈법칙 (Sum Rule)
항상 성립합니다. (독립 여부와 상관없음)
일반화하면:
예시: 주사위 두 개를 던질 때 나온 눈의 합의 기댓값 $ E(X+Y) = E(X) + E(Y) = 3.5 + 3.5 = 7 $
곱셈법칙 (Product Rule)
독립일 때만 성립합니다.
독립이 아니면 일반적으로
(공분산이 0이 아닌 경우)
2. 이산확률변수와 연속확률변수의 분산
분산의 정의는 동일합니다.
(1) 이산확률변수
또는
(2) 연속확률변수
또는
두 경우 모두 계산 공식 $ E(X^2) - [E(X)]^2 $을 더 자주 사용합니다.
3. 분산의 성질
- 상수
$Var(c) = 0$
- 상수배
Var(aX)=a2Var(X)Var(aX) = a^2 Var(X)(제곱이 붙는 것에 주의)
- 상수 더하기
$Var(aX) = a^2 Var(X)$(위치를 옮겨도 퍼진 정도는 그대로)
- 선형 변환
$Var(X + b) = Var(X)$
- 덧셈 (독립일 때)
$Var(aX + b) = a^2 Var(X)$
- 일반 덧셈 (독립이 아닐 때)
$Var(X + Y) = Var(X) + Var(Y) + 2Cov(X,Y)$
- 뺄셈
$Var(X - Y) = Var(X) + Var(Y) - 2Cov(X,Y)$독립이면 $ Var(X - Y) = Var(X) + Var(Y) $
4. 기댓값 vs 분산 성질 비교
| 상수 | $ E(c) = c $ | $ Var(c) = 0 $ |
| 상수배 | $ E(aX) = aE(X) $ | $ Var(aX) = a^2 Var(X) $ |
| 상수 더하기 | $ E(X+b) = E(X)+b $ | $ Var(X+b) = Var(X) $ |
| 덧셈 | 항상 $ E(X+Y)=E(X)+E(Y) $ | 독립일 때 $ Var(X+Y)=Var(X)+Var(Y) $ |
| 곱셈 | 독립일 때 $ E(XY)=E(X)E(Y) $ | - |
핵심 요약
- 기댓값 덧셈정리: 독립 여부 상관없이 항상 $ E(X+Y) = E(X)+E(Y) $
- 기댓값 곱셈정리: 독립일 때만 $ E(XY) = E(X)E(Y) $
- 분산 계산: 이산은 합, 연속은 적분 (또는 공통으로 $ E(X^2)-\mu^2 $)
- 분산의 핵심 성질:
상수배는 제곱이 됨 ($ a^2 $)
독립일 때 분산은 더해짐
상수를 더해도 분산은 변하지 않음
'AI > 확률|통계 기반' 카테고리의 다른 글
| 연속확률분포 주요 종류 정리 (0) | 2026.08.09 |
|---|---|
| 이산확률분포의 모든 것에 대해 (0) | 2026.08.08 |
| 기술통계/추출법에 대해 (0) | 2026.08.08 |
| 비정형 데이터 탐색 (0) | 2026.08.08 |
| 다변량 데이터 탐색 (1) | 2026.08.08 |