본문 바로가기

AI/확률|통계 기반

상관분석과 기초통계 분석 이해

1. 상관관계 분석이란?

두 개 이상의 변수 사이에 직선적인 관계의 강도와 방향을 수치로 나타내는 분석입니다.

  • 양의 상관: 한 변수가 커질 때 다른 변수도 커짐 (상관계수 > 0)
  • 음의 상관: 한 변수가 커질 때 다른 변수는 작아짐 (상관계수 < 0)
  • 무상관: 직선 관계가 거의 없음 (상관계수 ≈ 0)

가장 대표적으로 사용하는 것이 피어슨 상관계수(Pearson’s r)입니다.

$r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}$

 


2. 단순 상관 vs 다중 상관

구분단순 상관 (Simple Correlation)다중 상관 (Multiple Correlation)
의미 변수 2개 사이의 상관 변수 3개 이상의 상관
표현 $  R  $ (다중상관계수)
해석 두 변수의 직선 관계 강도 한 변수와 나머지 여러 변수들의 선형 조합 사이의 관계 강도
범위 -1 ~ +1 0 ~ 1 (방향 없음)
예시 공부시간과 성적의 상관 성적과 (공부시간 + 수면시간 + 스트레스)의 상관
 
 
  • 단순 상관: 가장 기본적인 상관분석
  • 다중 상관: 회귀분석에서 독립변수 전체와 종속변수 사이의 관계를 나타낼 때 주로 사용 (R R 은 결정계수 R2 R^2 의 제곱근)

3. 상관분석 / 회귀분석의 기본 가정

상관분석과 회귀분석은 공통적으로 여러 가정을 전제로 합니다. 특히 피어슨 상관선형 회귀에서 중요한 가정들은 다음과 같습니다.

(1) 선형성 (Linearity)

  • 변수들 사이에 직선 관계가 있어야 함
  • 곡선 관계(예: U자형)가 있으면 상관계수가 낮게 나오거나 왜곡됨
  • 확인 방법: 산점도(Scatter Plot)를 그려서 직선 형태인지 확인

(2) 등분산성 (Homoscedasticity)

  • 독립변수 값에 따라 잔차의 분산이 일정해야 함
  • 잔차가 깔때기 모양으로 퍼지거나 좁아지면 등분산성 위반
  • 확인 방법: 잔차 산점도 (예측값 vs 잔차)

(3) 정규성 (Normality)

  • 피어슨 상관계수의 경우, 두 변수가 이변량 정규분포를 따른다고 가정
  • 회귀분석에서는 잔차가 정규분포를 따라야 함
  • 확인 방법:
    • 히스토그램, Q-Q Plot
    • 왜도·첨도 확인
    • Shapiro-Wilk 검정 등

(4) 독립성 (Independence) / 무선독립성

  • 각 관측치가 서로 독립이어야 함
  • 시계열 데이터처럼 앞뒤 값이 영향을 주면 독립성 위반 (자기상관 발생)
  • 확인 방법:
    • Durbin-Watson 검정
    • 잔차의 자기상관 함수(ACF) 확인

(5) 그 외 중요한 조건

  • 이상치에 민감: 이상치 하나가 상관계수를 크게 왜곡할 수 있음
  • 인과관계가 아님: 상관은 관계의 강도만 나타낼 뿐, 원인-결과를 의미하지 않음

4. 가정 위반 시 대처 방법

가정위반 시 문제대처 방법
선형성 관계 왜곡 변수 변환(로그 등), 비선형 모델 사용
등분산성 추정 효율 저하, 검정 오류 변수 변환, 가중회귀, 강건한 표준오차
정규성 검정 결과 신뢰성 저하 변수 변환, 비모수 상관(스피어만) 사용
독립성 표준오차 왜곡 시계열 모델, 혼합효과 모델 등 사용
 
 

5. 요약

  • 단순 상관: 변수 2개의 직선 관계
  • 다중 상관: 한 변수와 여러 변수 조합의 관계
  • 기본 가정 4가지:
    1. 선형성 – 직선 관계가 있어야 함
    2. 등분산성 – 잔차 분산이 일정해야 함
    3. 정규성 – 변수 또는 잔차가 정규분포를 따라야 함
    4. 독립성 – 관측치들이 서로 독립이어야 함

이 가정들이 만족될 때 피어슨 상관계수와 선형 회귀분석 결과를 신뢰할 수 있습니다. 가정이 의심될 때는 산점도와 잔차 그림을 반드시 확인하는 것이 좋습니다.

 

 

1. 스피어만 상관이란?

피어슨 상관이 직선 관계를 측정한다면, 스피어만 상관은 단조 관계(Monotonic Relationship)를 측정합니다.

  • 한 변수가 증가할 때 다른 변수도 일관되게 증가하거나 감소하는 관계
  • 반드시 직선일 필요는 없음 (곡선이어도 됨)
  • 순위(Rank)를 이용해서 계산하는 비모수(Non-parametric) 방법

2. 계산 원리

  1. 각 변수의 값을 순위로 변환한다.
  2. 순위로 변환된 데이터에 대해 피어슨 상관을 계산한다.

공식 (동점이 없을 때)

$\rho = 1 - \frac{6\sum d_i^2}{n(n^2-1)}$

 

 

  • $  d_i  $: 두 변수 순위 차이의 제곱
  • $  n  $: 데이터 개수

동점이 있을 경우에는 평균 순위를 부여하고, 피어슨 공식을 순위에 그대로 적용합니다.


3. 피어슨 vs 스피어만 비교

구분피어슨 상관 (Pearson)스피어만 상관 (Spearman)
측정하는 관계 직선 관계 (Linear) 단조 관계 (Monotonic)
데이터 수준 연속형 + 정규분포 가정 순위형, 연속형 모두 가능
이상치 영향 매우 민감 상대적으로 강함
가정 선형성, 정규성, 등분산성 등 가정이 거의 없음
사용 상황 정규분포를 따르는 연속형 데이터 정규성 위배, 이상치 존재, 순서형 데이터, 비선형이지만 단조인 경우
해석 -1 ~ +1 -1 ~ +1 (피어슨과 동일)
 
 

4. 스피어만을 사용해야 하는 경우

  • 데이터가 정규분포를 따르지 않을
  • 이상치가 확실히 존재할 때
  • 변수가 순서형(Ordinal)일 때 (예: 만족도 1~5점, 등급)
  • 산점도를 그렸을 때 곡선 형태이지만 일관된 증가/감소 추세가 보일 때
  • 표본 크기가 작을 때

5. 실제 해석 예시

  • 스피어만 $  \rho = 0.85  $ → 두 변수 사이에 강한 양의 단조 관계가 있다.
  • 피어슨 $  r = 0.40  $, 스피어만 $  \rho = 0.82  $ →
    직선 관계는 약하지만, 순서로 보면 강한 관계가 있다 (비선형 단조 관계일 가능성)

6. 요약

  • 피어슨: 직선 관계를 보는 모수적 방법 (가정 많음)
  • 스피어만: 순위 기반으로 단조 관계를 보는 비모수적 방법 (가정 적음, 이상치에 강함)

상관분석을 할 때는 산점도를 먼저 그려보고, 정규성과 이상치 여부를 확인한 뒤 피어슨과 스피어만 중 어떤 것을 쓸지 결정하는 것이 좋습니다. 두 계수를 모두 제시하고 비교하는 경우도 많습니다.

 

 

 

 

기초 통계 핵심 개념 정리 (모평균·표본평균, 기하평균·조화평균, 중앙값·최빈값, 분위수)

실제 예시를 들어가며 설명하겠습니다.


1. 모평균과 표본평균

구분모평균 (Population Mean)표본평균 (Sample Mean)
기호 $  \mu  $ (뮤) $  \bar{x}  $ (엑스바)
의미 전체 집단의 평균 전체 중 일부를 뽑아 구한 평균
공식
 
예시

한 대학교 전체 학생 수 $  N = 10,000  $명의 평균 키가 모평균 $  \mu  $입니다.
이 중 100명을 뽑아 키를 재서 구한 평균이 표본평균 $  \bar{x}  $입니다.

모평균은 실제로 구하기 어려운 경우가 많아서,
우리는 표본평균으로 모평균을 추정합니다.


2. 기하평균과 조화평균

산술평균 외에 자주 쓰이는 평균입니다.

(1) 기하평균 (Geometric Mean)

공식

$\text{기하평균} = \sqrt[n]{x_1 \times x_2 \times \cdots \times x_n}$

 

 

특징: 비율, 성장률, 수익률처럼 곱셈으로 변하는 데이터에 적합

예시 어떤 투자 상품의 3년간 수익률이 다음과 같다고 가정합니다.

  • 1년차: +20% (1.20배)
  • 2년차: -10% (0.90배)
  • 3년차: +30% (1.30배)

산술평균으로 하면 $  (20 - 10 + 30)/3 = 13\%  $가 되지만,
실제 최종 수익을 반영하려면 기하평균을 써야 합니다.

$\text{기하평균} = \sqrt[3]{1.20 \times 0.90 \times 1.30} \approx 1.125 \rightarrow 약 12.5\%$

 

 

(2) 조화평균 (Harmonic Mean)

공식

$\text{조화평균} = \frac{n}{\frac{1}{x_1} + \frac{1}{x_2} + \cdots + \frac{1}{x_n}}$

 

 

특징: 속도, 밀도, 비율의 역수 관계에 적합

예시 서울에서 부산까지 갈 때와 올 때 속도가 다릅니다.

  • 갈 때: 시속 80km
  • 올 때: 시속 120km

평균 속도는 산술평균 100km/h가 아닙니다.

$\text{조화평균} = \frac{2}{\frac{1}{80} + \frac{1}{120}} = \frac{2}{\frac{3+2}{240}} = 96\text{km/h}$

 

 

거리와 시간을 제대로 반영한 평균 속도입니다.


3. 중앙값 (Median)

데이터를 크기 순으로 정렬했을 때 가운데 있는 값입니다.

  • 이상치에 영향을 거의 받지 않음
  • 분포가 비대칭일 때 평균보다 중심 위치를 더 잘 나타냄

예시 5명의 월급 (만원): 250, 280, 300, 320, 1500

  • 평균 = (250+280+300+320+1500)/5 = 530만원 (이상치 때문에 왜곡)
  • 중앙값 = 300만원 (현실적인 중심)

4. 최빈값 (Mode)

데이터에서 가장 자주 나타나는 값입니다.

  • 범주형 데이터에서 특히 유용
  • 여러 개일 수 있음 (다봉분포)

예시 학생 20명의 혈액형:

  • A형: 7명
  • B형: 5명
  • O형: 6명
  • AB형: 2명

→ 최빈값 = A형

연속형 데이터에서는 구간을 나누어 최빈 구간을 찾기도 합니다.


5. 분위수 (Quantile)

데이터를 크기 순으로 정렬한 후 위치를 비율로 나타낸 값입니다.

분위수의미
사분위수 25%, 50%, 75% 지점 (Q1, Q2, Q3)
백분위수 1% 단위로 나눈 것 (예: 90백분위수)
십분위수 10% 단위
 
 

예시 시험 점수 100명의 데이터가 있을 때,

  • 75백분위수(Q3) = 82점 → 상위 25%에 들려면 82점 이상 필요
  • 25백분위수(Q1) = 58점 → 하위 25%는 58점 이하

사분위수와 IQR

  • Q1: 25% 지점
  • Q2: 50% 지점 (중앙값)
  • Q3: 75% 지점
  • IQR = Q3 - Q1 (가운데 50%의 범위)

한눈에 보는 비교

통계량언제 주로 사용하는가이상치 영향
산술평균 일반적인 중심 매우 큼
기하평균 성장률, 수익률, 비율 중간
조화평균 속도, 평균 비율 중간
중앙값 비대칭 분포, 이상치 있을 때 거의 없음
최빈값 범주형, 가장 흔한 값 없음
분위수 위치와 상대적 순위 파악 적음
 
 

요약

  • 모평균은 전체의 진짜 평균, 표본평균은 그 추정값
  • 기하평균은 곱의 평균 (성장률), 조화평균은 역수의 평균 (속도)
  • 중앙값은 이상치에 강한 중심값
  • 최빈값은 가장 자주 나오는 값
  • 분위수는 데이터를 비율로 나눈 위치값 (사분위수가 가장 많이 사용됨)

이 개념들을 잘 구분해서 사용하면 데이터의 중심과 위치를 상황에 맞게 정확히 파악할 수 있습니다.

 

 

 

산포도(산포 측도) 관련 개념을 정리

산포도는 데이터가 평균(또는 중심)으로부터 얼마나 퍼져 있는지를 나타내는 통계량입니다.


1. 범위 (Range)

정의

$\text{범위} = \text{최댓값} - \text{최솟값}$

 

 

특징

  • 계산이 가장 간단
  • 이상치에 매우 민감 (최댓값이나 최솟값 하나에 크게 영향받음)
  • 데이터의 전체적인 퍼짐만 대략적으로 알 수 있음

예시 데이터: 10, 12, 15, 18, 50 범위 = 50 - 10 = 40


2. 분산 (Variance)

정의 데이터가 평균으로부터 얼마나 떨어져 있는지를 제곱하여 평균 낸 값입니다.

  • 모분산 ($  \sigma^2  $):

$\sigma^2 = \frac{\sum (x_i - \mu)^2}{N}$

 

 

  • 표본분산 ($  s^2  $):

$s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1}$

 

(※ $  n-1  $로 나누는 이유: 불편추정량이 되도록 하기 위함)

 

특징

  • 제곱을 하기 때문에 단위가 원래 단위의 제곱이 됨
  • 이상치에 민감
  • 수학적으로 다루기 편리하여 통계학에서 가장 기본이 되는 산포 측도

3. 표준편차 (Standard Deviation)

정의 분산에 제곱근을 취한 값입니다.

$\sigma = \sqrt{\sigma^2}, \quad s = \sqrt{s^2}$

 

 

특징

  • 원래 데이터와 같은 단위를 가짐 → 해석이 쉬움
  • 가장 널리 사용되는 산포 측도
  • 정규분포에서 평균 ± 1σ, ± 2σ, ± 3σ 규칙으로 활용

예시 평균이 70점, 표준편차가 5점이라면 대부분의 학생이 65~75점 사이에 있다고 볼 수 있습니다.


4. 평균 절대 편차 (MAD, Mean Absolute Deviation)

정의 평균(또는 중앙값)으로부터의 편차를 절댓값으로 평균 낸 값입니다.

$\text{MAD} = \frac{\sum |x_i - \bar{x}|}{n}$

 

 

(중앙값을 기준으로 하면 Median Absolute Deviation이라고 부름)

특징

  • 제곱을 하지 않기 때문에 이상치에 덜 민감
  • 해석이 직관적 (“평균적으로 얼마나 떨어져 있는가”)
  • 수학적으로 미분 등이 불편하여 이론적으로는 분산보다 덜 쓰임

5. 사분위범위 (IQR, Interquartile Range)

정의

$\text{IQR} = Q3 - Q1$

 

 

특징

  • 데이터의 가운데 50%의 퍼짐 정도를 나타냄
  • 이상치에 매우 강함 (양쪽 25%씩을 아예 배제)
  • 박스플롯의 핵심 구성 요소
  • 비대칭 분포나 이상치가 많은 데이터에서 표준편차보다 더 좋은 산포 측도가 됨

6. 변동계수 (CV, Coefficient of Variation)

정의

$\text{CV} = \frac{\text{표준편차}}{\text{평균}} \times 100(\%)$

 

 

특징

  • 단위가 다른 데이터평균 크기가 다른 데이터의 산포를 비교할 때 사용
  • 상대적인 산포를 나타냄
  • 평균이 0에 가까우면 사용하기 어려움

예시

  • A 제품 무게: 평균 50g, 표준편차 2g → CV = 4%
  • B 제품 무게: 평균 200g, 표준편차 6g → CV = 3%

절대적인 표준편차는 B가 더 크지만, 상대적으로는 A가 더 많이 퍼져 있다고 볼 수 있습니다.


한눈에 비교

산포 측도이상치 영향단위주요 사용 상황
범위 매우 큼 원래 단위 간단한 전체 범위 파악
분산 제곱 단위 통계 이론, 추론
표준편차 원래 단위 가장 일반적인 산포 측도
MAD 작음 원래 단위 이상치에 강한 평균 편차
IQR 매우 작음 원래 단위 비대칭·이상치 많은 데이터
변동계수(CV) % (상대값) 서로 다른 집단·단위 비교
 
 

요약

  • 퍼짐의 절대적 크기 보고 싶을 표준편차, IQR, MAD
  • 이상치에 영향 받지 않고 싶을 IQR > MAD > 표준편차
  • 서로 다른 데이터 상대적 산포를 비교하고 싶을 변동계수(CV)
  • 통계적 추론과 모델링에서는 분산과 표준편차 기본이 됩니다.