← 목록으로
AI 기술 공통파생 용어난이도 중

반지도학습

「머신러닝 (Machine Learning)」의 파생 용어입니다.
반지도학습은 소량의 레이블된 데이터와 대량의 레이블 없는 데이터를 함께 활용하여 모델을 학습시키는 머신러닝 방법론이다. 완전한 지도학습에 비해 데이터 레이블링 비용을 크게 줄이면서도 높은 학습 성능을 달성할 수 있다는 점에서 실무적 활용 가치가 높다.
관련 개념 웹툰 상위 용어 「머신러닝 (Machine Learning)」
머신러닝 (Machine Learning) — 4컷 웹툰 설명
  1. 11컷: 규칙을 몰라 멍한 로봇
  2. 22컷: 데이터를 잔뜩 먹기 시작!
  3. 33컷: 반복할수록 똑똑해지는 중
  4. 44컷: 스스로 답을 찾아낸 로봇

정의와 배경

머신러닝의 학습 방식은 크게 지도학습(Supervised Learning), 비지도학습(Unsupervised Learning), 강화학습으로 구분된다. 지도학습은 입력 데이터에 정답 레이블이 붙어 있어야 하므로, 대규모 학습을 위해서는 전문가의 수작업 레이블링이 필요하다. 그러나 현실에서는 레이블 없는 데이터가 압도적으로 많고 레이블링 비용이 상당하기 때문에, 두 유형의 데이터를 혼합하여 활용하는 반지도학습이 실용적 대안으로 부상하였다. '준지도학습'이라는 표현도 동일한 개념을 지칭하며, 영어로는 Semi-supervised Learning으로 통용된다.

작동 원리와 주요 기법

반지도학습의 기본 원리는 소량의 레이블 데이터로 초기 판단 기준을 형성한 뒤, 레이블 없는 데이터에서 발견되는 데이터 분포·군집 구조를 이용해 모델의 이해를 확장하는 것이다. 대표적인 기법으로는 자기 학습(Self-training), 공동 학습(Co-training), 그래프 기반 레이블 전파(Label Propagation), 일관성 정규화(Consistency Regularization) 등이 있다. 자기 학습은 모델이 레이블 없는 데이터에 스스로 예측값을 부여하고 이를 학습에 재활용하는 방식이며, 일관성 정규화는 동일한 입력에 약간의 변형을 가해도 예측이 일관되도록 훈련하는 방식이다. 최근에는 대규모 언어모델 사전학습 과정에서도 반지도학습의 원리가 광범위하게 응용되고 있다.

지도학습·비지도학습과의 비교

지도학습은 모든 학습 데이터에 레이블이 필요하므로 정확도는 높지만 데이터 구축 비용이 크다. 비지도학습은 레이블 없이 데이터의 패턴만을 파악하므로 비용은 낮지만 특정 과업에 대한 정확한 예측이 어렵다. 반지도학습은 두 방식의 장점을 절충하여, 제한된 레이블 데이터만으로도 비교적 높은 예측 성능을 달성할 수 있다. 이러한 특성 덕분에 의료 영상 판독, 문서 분류, 음성 인식 등 전문가 레이블링이 어렵고 비용이 높은 분야에서 특히 주목받는다.

왜 중요한가

공공·산업 현장에서 AI를 도입할 때 가장 큰 장벽 중 하나는 고품질 학습 데이터 확보 비용이다. 반지도학습은 이 비용을 낮추면서도 모델 성능을 유지할 수 있는 현실적 접근법으로, AI 대전환 시대의 데이터 효율성 전략과 직결된다. 특히 정부가 추진하는 공공 데이터 기반 AI 서비스 개발에서, 레이블 구축 예산이 제한된 상황에도 활용 가능한 학습 전략으로서 정책적 관심이 높아지고 있다.

※ 본 상세 설명은 용어집 데이터를 토대로 AI가 생성했습니다. 정확한 내용은 원문 출처를 우선하세요.

?확인 문제0/2
「반지도학습」은(는) 어느 기본 용어에서 파생된 개념인가요?
「반지도학습」은(는) 어느 계열에 속하나요?