본문 바로가기

AI/확률|통계 기반

비정형 데이터 탐색

1. 비정형 데이터란?

정해진 형식이나 구조가 없는 데이터를 말합니다.

구분설명예시
정형 데이터 행과 열로 딱 맞는 표 형태 엑셀, 데이터베이스 테이블
반정형 데이터 어느 정도 태그는 있지만 표처럼 엄격하지 않음 JSON, XML, HTML, 로그
비정형 데이터 구조가 거의 없거나 매우 자유로움 텍스트, 이미지, 음성, 영상, SNS 글
 

현재 전 세계 데이터의 80~90% 이상이 비정형 데이터로 추정됩니다.


2. 비정형 데이터의 특징

  • 구조가 없다: 필드(컬럼)가 미리 정의되어 있지 않음
  • 용량이 크다: 텍스트 하나, 이미지 하나, 영상 하나가 정형 데이터보다 훨씬 큼
  • 다양성이 높다: 언어, 형식, 품질이 제각각
  • 노이즈가 많다: 오탈자, 이모티콘, 배경 소음, 흐릿한 이미지 등
  • 의미가 숨어 있다: 표면적인 값보다 “의미”와 “맥락”을 추출해야 함
  • 처리가 어렵다: 전통적인 SQL이나 통계 기법만으로는 분석이 거의 불가능
  • 가치가 높다: 고객 의견, 감정, 행동 패턴 등 정형 데이터에서 얻기 힘든 인사이트를 담고 있음

3. 비정형 데이터의 주요 형태와 종류

종류세부 형태대표 예시
텍스트 문서, SNS, 리뷰, 이메일, 채팅, 뉴스 상품 리뷰, 트위터, 보고서, 계약서
이미지 사진, 그림, 스캔 문서, 의료 영상 제품 사진, X-ray, CCTV 캡처
음성/오디오 녹음 파일, 통화 기록, 음악, 팟캐스트 고객 상담 녹음, 음성 메모
영상 동영상, 스트리밍, CCTV 유튜브, 매장 모니터링, 자율주행 영상
기타 센서 로그, 클릭스트림, PDF, 웹페이지 IoT 센서 값, 웹 로그, 스캔된 문서
 

4. 비정형 데이터 관리 및 분석의 의미

왜 중요한가?

  • 정형 데이터만으로는 알 수 없는 고객의 진짜 목소리, 감정, 행동 맥락을 파악할 수 있음
  • 새로운 비즈니스 기회와 리스크를 조기에 발견
  • 검색, 추천, 자동화, 이상 탐지 등 고부가가치 서비스의 기반이 됨

분석으로 도출할 수 있는 의미(인사이트)

  • 고객이 무엇을 좋아하고 싫어하는지 (감성·의견)
  • 어떤 주제가 갑자기 떠오르고 있는지 (트렌드)
  • 문서나 이미지 속에 숨겨진 정보 추출 (정보 추출)
  • 이상 행동이나 위험 신호 탐지
  • 콘텐츠 자동 분류·태깅·요약

관리의 어려움

  • 저장 공간과 비용이 큼
  • 메타데이터(누가, 언제, 어디서 만들었는지) 관리가 중요
  • 보안·개인정보 이슈가 정형 데이터보다 복잡
  • 품질 관리(중복, 노이즈, 편향)가 어려움

5. 비정형 데이터 분석 방법 (매우 구체적으로)

(1) 텍스트 데이터 분석 (가장 기본이자 중요)

전처리 단계

  • 토큰화 (단어/형태소 분리)
  • 불용어 제거
  • 정규화 (소문자 변환, 어간 추출, 표제어 추출)
  • 맞춤법·오탈자 교정
  • 정규표현식으로 특수문자·URL 제거

주요 분석 기법

기법설명활용 예시
빈도 분석 / TF-IDF 단어 중요도 계산 핵심 키워드 추출
감성 분석 긍정/부정/중립 분류 리뷰·SNS 여론 분석
토픽 모델링 (LDA, NMF) 문서에 숨겨진 주제 발견 고객 불만 유형 분류
단어 임베딩 (Word2Vec, FastText, GloVe) 단어를 벡터로 변환 유사 단어 찾기, 의미 분석
문장/문서 임베딩 (BERT, Sentence-BERT) 문맥을 반영한 벡터화 유사 문서 검색, 분류
개체명 인식 (NER) 인명, 지명, 기관명 등 추출 정보 추출
관계 추출 개체 간 관계 파악 지식 그래프 구축
텍스트 요약 추출적/추상적 요약 보고서·뉴스 자동 요약
트랜스포머 기반 모델 BERT, GPT, RoBERTa 등 고성능 분류, 생성, 질의응답
 

(2) 이미지 데이터 분석

  • 특징 추출: SIFT, HOG (전통적) → CNN이 자동으로 특징 학습
  • 분류: 이미지가 무엇인지 판별 (예: 고양이/개)
  • 객체 탐지: YOLO, Faster R-CNN → 어디에 무엇이 있는지 찾아냄
  • 분할 (Segmentation): 픽셀 단위로 영역 나누기
  • 유사 이미지 검색: 임베딩 벡터로 비슷한 이미지 찾기
  • OCR: 이미지 속 글자를 텍스트로 변환
  • 생성 모델: GAN, Diffusion Model로 이미지 생성·복원

(3) 음성·오디오 데이터 분석

  • 음성 인식 (STT): 음성을 텍스트로 변환 (Whisper, Google STT 등)
  • 화자 분리·인식: 누가 말했는지 구분
  • 감정 인식: 목소리 톤으로 감정 파악
  • 음향 특징 추출: MFCC, Spectrogram
  • 이상 소리 탐지: 기계 고장 소리, 비명 등

(4) 영상 데이터 분석

  • 이미지를 프레임 단위로 나누어 분석
  • 객체 추적 (Tracking)
  • 행동 인식 (Action Recognition)
  • 장면 이해, 요약, 이상 행동 탐지

(5) 공통·고급 접근법

  • 임베딩 + 벡터 검색: 모든 비정형 데이터를 벡터로 바꿔 유사도 검색 (Vector DB 활용)
  • 멀티모달 분석: 텍스트+이미지, 음성+텍스트를 함께 분석 (CLIP, GPT-4o 등)
  • 클러스터링: 비정형 데이터를 벡터화한 후 군집 분석
  • 이상 탐지: 정상 패턴에서 벗어난 비정형 데이터 탐지

6. 실무 분석 흐름 (권장)

  1. 수집: 크롤링, API, 로그, 센서 등
  2. 저장: 데이터 레이크 (S3, HDFS 등) + 메타데이터 관리
  3. 전처리: 노이즈 제거, 형식 통일, 샘플링
  4. 특징 추출/임베딩: 텍스트→벡터, 이미지→벡터 등
  5. 분석·모델링: 분류, 군집, 토픽, 감성, 탐지 등
  6. 해석·시각화: 결과를 사람이 이해할 수 있게 표현
  7. 활용: 대시보드, 추천, 자동화, 의사결정 지원

요약

비정형 데이터는 구조가 없고 복잡하지만, 그 안에 고객의 진짜 생각과 행동, 새로운 패턴이 숨겨져 있습니다.

분석의 핵심은 “비정형 데이터를 컴퓨터가 이해할 수 있는 수치(벡터)로 바꾼 뒤, 통계·머신러닝·딥러닝 기법으로 의미를 추출하는 것”입니다.

텍스트가 가장 기본이 되며, 최근에는 임베딩 + 대규모 언어모델(LLM) 접근이 거의 표준이 되고 있습니다.

 

 

 

텍스트 마이닝, 오피니언 마이닝, 웹 마이닝 


1. 텍스트 마이닝 (Text Mining)

정의 비정형 텍스트 데이터에서 유용한 정보, 패턴, 지식을 추출하는 과정입니다. 데이터 마이닝 기법을 텍스트에 적용한 것으로, “텍스트를 분석 가능한 형태로 바꾼 뒤 의미를 찾아내는 기술”입니다.

주요 목적

  • 대량의 문서에서 핵심 정보 자동 추출
  • 숨겨진 주제나 패턴 발견
  • 문서 분류, 요약, 검색 고도화
  • 의사결정에 필요한 인사이트 도출

전체 과정 (Pipeline)

  1. 수집: 문서, 이메일, 보고서, SNS, 뉴스 등
  2. 전처리
    • 토큰화 (단어/형태소 분리)
    • 불용어 제거
    • 정규화 (소문자 변환, 어간·표제어 추출)
    • 특수문자·숫자·URL 제거
    • 맞춤법 교정
  3. 특징 추출 (벡터화)
    • 가방 단어(Bag-of-Words)
    • TF-IDF
    • Word2Vec, FastText, GloVe
    • BERT 등 문맥 기반 임베딩
  4. 분석·모델링
    • 분류, 군집, 토픽 모델링, 연관 분석, 요약 등
  5. 해석 및 시각화
    • 워드클라우드, 네트워크 그래프, 토픽별 키워드 등

주요 기법

기법설명대표 활용
TF-IDF 단어 중요도 계산 키워드 추출
토픽 모델링 (LDA, NMF) 문서에 숨겨진 주제 발견 뉴스·리뷰 주제 분석
텍스트 분류 카테고리 자동 분류 스팸 필터, 문서 분류
개체명 인식 (NER) 인명, 지명, 기관명 추출 정보 추출
텍스트 요약 추출적/추상적 요약 보고서 자동 요약
단어/문장 임베딩 의미를 벡터로 표현 유사 문서 검색
 

활용 분야

  • 고객 리뷰·불만 분석
  • 법률·의료 문서 검색 및 분류
  • 뉴스 토픽 트렌드 분석
  • 채용 공고·이력서 매칭
  • 지식 관리 시스템

주요 어려움

  • 언어의 모호성, 다의어, 문맥 의존성
  • 신조어·은어·오탈자
  • 언어별 특성 차이 (한국어는 교착어라 형태소 분석이 중요)

2. 오피니언 마이닝 (Opinion Mining)

정의 텍스트에서 의견, 평가, 감정, 태도를 추출하고 분석하는 기술입니다. 흔히 감성 분석 (Sentiment Analysis)이라고도 부르며, 텍스트 마이닝의 중요한 하위 분야입니다.

핵심 목표

  • 긍정/부정/중립 판단
  • 감정의 강도 측정
  • 무엇에 대한 의견인지 (Aspect) 파악
  • 의견의 주체와 대상 식별

분석 수준

수준설명예시
문서 수준 문서 전체의 감성 이 리뷰는 전반적으로 긍정
문장 수준 문장별 감성 “배송은 빠른데 품질은 별로다”
측면(Aspect) 수준 특정 속성에 대한 감성 배터리(긍정), 카메라(부정)
비교 의견 A가 B보다 좋다 “이 제품이 경쟁사보다 낫다”
 

주요 접근 방법

  1. 사전 기반 (Lexicon-based)
    • 긍정/부정 단어 사전을 이용해 점수 계산
    • 빠르고 해석이 쉽지만, 문맥·부정어 처리에 약함
  2. 머신러닝 기반
    • 나이브 베이즈, SVM, 랜덤 포레스트 등으로 분류
    • 학습 데이터가 필요
  3. 딥러닝·트랜스포머 기반
    • BERT, RoBERTa, GPT 등을 파인튜닝
    • 현재 가장 성능이 좋음
    • 문맥을 잘 이해하고 비꼬는 표현도 어느 정도 처리 가능
  4. Aspect-Based Sentiment Analysis (ABSA)
    • “무엇에 대해 어떻게 평가했는지”를 세밀하게 분석
    • 예: “화면은 좋은데 배터리가 너무 빨리 닳아요”

활용 분야

  • 제품·서비스 리뷰 분석
  • SNS 여론 모니터링
  • 브랜드 평판 관리
  • 정치·선거 여론 분석
  • 고객 지원 우선순위 결정
  • 주식·암호화폐 감성 지표

주요 어려움

  • 비꼬는 말, 반어법, 이모티콘
  • 도메인마다 단어 의미가 달라짐 (예: “작다”가 긍정일 수도, 부정일 수도)
  • 다국어·방언·신조어
  • 중립과 약한 감정의 경계

3. 웹 마이닝 (Web Mining)

정의 웹에 존재하는 데이터를 마이닝하여 유용한 정보와 패턴을 추출하는 기술입니다. 웹 문서, 링크 구조, 사용자 행동 로그 등을 모두 포함합니다.

웹 마이닝의 3가지 유형

유형분석 대상주요 목적대표 기법
웹 콘텐츠 마이닝 웹 페이지 내용 (텍스트, 이미지, 영상) 정보 추출, 분류, 추천 텍스트 마이닝, 정보 추출, 토픽 모델링
웹 구조 마이닝 페이지 간 링크 구조 중요 페이지 발견, 커뮤니티 탐지 PageRank, HITS, 그래프 분석
웹 사용 마이닝 사용자 로그, 클릭스트림, 세션 행동 패턴, 개인화, 추천 순차 패턴, 군집, 연관 규칙
 

세부 설명

① 웹 콘텐츠 마이닝

  • 웹 페이지의 텍스트·이미지·메타데이터를 분석
  • 검색 엔진의 문서 분류, 뉴스 기사 수집·분석, 가격 비교 등에 사용
  • 텍스트 마이닝 기법이 그대로 활용됨

② 웹 구조 마이닝

  • 하이퍼링크를 그래프로 보고 분석
  • PageRank: 중요한 페이지일수록 많은 좋은 페이지로부터 링크를 받는다는 아이디어
  • 웹 페이지의 권위(Authority)와 허브(Hub) 점수 계산
  • 커뮤니티 탐지, 스팸 페이지 탐지 등에 사용

③ 웹 사용 마이닝

  • 웹 서버 로그, 쿠키, 클릭스트림 데이터 분석
  • 사용자가 어떤 경로로 이동하는지, 어디서 이탈하는지 파악
  • 개인화 추천, 웹사이트 구조 개선, 마케팅 캠페인 효과 측정에 활용
  • 세션 식별 → 경로 분석 → 패턴 발견 → 추천/개선

웹 마이닝의 주요 과정

  1. 데이터 수집 (크롤링, 로그 수집, API)
  2. 전처리 (HTML 파싱, 세션 정리, 봇 제거)
  3. 패턴 발견 (연관, 순차, 군집, 분류)
  4. 분석 결과 활용 (검색 순위, 추천, 개인화, 광고)

활용 분야

  • 검색 엔진 최적화 및 랭킹
  • 전자상거래 추천 시스템
  • 웹사이트 사용성 개선
  • 소셜 네트워크 분석
  • 웹 스팸·어뷰징 탐지
  • 경쟁사 모니터링

주요 어려움

  • 웹 데이터의 규모와 변화 속도가 매우 큼
  • 동적 페이지, 자바스크립트 렌더링 문제
  • 개인정보 보호와 크롤링 윤리·법적 이슈
  • 봇과 실제 사용자 구분
  • 다국어·다양한 형식의 콘텐츠

세 기술의 관계 정리

웹 마이닝
 ├── 웹 콘텐츠 마이닝  ←── 텍스트 마이닝이 핵심 도구
 │         └── 오피니언 마이닝 (감성·의견 분석)
 ├── 웹 구조 마이닝
 └── 웹 사용 마이닝
  • 텍스트 마이닝은 가장 기본이 되는 기술
  • 오피니언 마이닝은 텍스트 마이닝 중에서 “의견·감정”에 특화된 분야
  • 웹 마이닝은 웹이라는 특수한 환경의 데이터를 다루며, 텍스트 마이닝과 오피니언 마이닝을 포함하면서도 링크 구조와 사용자 행동까지 분석 범위를 넓힌 개념

'AI > 확률|통계 기반' 카테고리의 다른 글

확률분포의 전반에 대해  (0) 2026.08.08
기술통계/추출법에 대해  (0) 2026.08.08
다변량 데이터 탐색  (1) 2026.08.08
고급데이터 탐색  (0) 2026.08.08
상관분석과 기초통계 분석 이해  (0) 2026.08.08