← 목록으로
AI 기술 공통파생 용어난이도 기본

과적합(Overfitting)

Overfitting
「머신러닝 (Machine Learning)」의 파생 용어입니다.
과적합이란 머신러닝 모델이 학습 데이터에 지나치게 최적화된 나머지, 새로운 데이터에 대한 예측 성능이 크게 떨어지는 현상이다. 모델이 데이터의 일반적인 패턴이 아닌 노이즈나 특이값까지 암기하듯 학습한 결과로 발생하며, AI 모델의 실용성을 저해하는 대표적인 문제 중 하나다.
관련 개념 웹툰 상위 용어 「머신러닝 (Machine Learning)」
머신러닝 (Machine Learning) — 4컷 웹툰 설명
  1. 11컷: 규칙을 몰라 멍한 로봇
  2. 22컷: 데이터를 잔뜩 먹기 시작!
  3. 33컷: 반복할수록 똑똑해지는 중
  4. 44컷: 스스로 답을 찾아낸 로봇

정의와 배경

과적합은 머신러닝 모델이 훈련에 사용된 학습 데이터에는 높은 정확도를 보이지만, 실제 현장에서 접하는 새로운 데이터(테스트 데이터 또는 실전 데이터)에는 성능이 현저히 낮아지는 상태를 말한다. 이는 모델이 데이터 속의 일반적이고 본질적인 패턴을 학습하는 대신, 해당 학습 데이터에만 나타나는 우연한 특성이나 오류까지 학습했기 때문이다. 반대 개념인 과소적합(Underfitting)은 모델이 학습 데이터조차 제대로 설명하지 못하는 경우를 가리킨다.

발생 원인과 주요 징후

과적합은 주로 모델의 복잡도가 학습 데이터의 양이나 다양성에 비해 지나치게 높을 때 발생한다. 예를 들어 학습 데이터가 적은 상황에서 수백만 개의 파라미터를 가진 딥러닝 모델을 훈련시키면, 모델은 데이터의 패턴보다 개별 사례를 통째로 기억하는 경향을 보인다. 실무에서는 학습 데이터에 대한 정확도는 높은데 검증 데이터나 테스트 데이터에 대한 정확도가 현격히 낮을 때 과적합을 의심한다.

예방 및 완화 기법

과적합을 줄이기 위한 대표적인 방법으로는 드롭아웃(Dropout), 정규화(Regularization), 조기 종료(Early Stopping), 교차 검증(Cross-validation) 등이 있다. 드롭아웃은 학습 과정에서 신경망의 일부 노드를 무작위로 비활성화해 모델이 특정 패턴에 과도하게 의존하지 않도록 유도한다. 또한 학습 데이터의 양을 늘리거나 데이터 증강(Data Augmentation) 기법을 통해 다양한 사례를 제공하는 것도 효과적인 예방책이다. 파인튜닝 과정에서도 특정 도메인 데이터가 지나치게 적을 경우 과적합이 발생할 수 있어 주의가 필요하다.

정책·실무적 함의

공공 AI 시스템을 도입하거나 검증할 때, 학습 데이터 기준의 성능 지표만으로 모델을 평가하면 과적합된 모델이 실전 배포 후 심각한 오류를 일으킬 수 있다. 따라서 정부·공공기관이 AI 모델의 성능을 검증할 때는 반드시 학습에 사용되지 않은 독립적인 데이터셋을 활용한 평가 절차를 요구해야 한다. 이는 AI 신뢰성·안전성 확보를 위한 공공 AI 거버넌스의 기본 원칙과도 직결된다.

※ 본 상세 설명은 용어집 데이터를 토대로 AI가 생성했습니다. 정확한 내용은 원문 출처를 우선하세요.

?확인 문제0/2
「과적합(Overfitting)」은(는) 어느 기본 용어에서 파생된 개념인가요?
「과적합(Overfitting)」은(는) 어느 계열에 속하나요?