
- 1뇌처럼 생긴 신경망, 층층이 쌓아볼까?
- 2데이터가 층을 통과하며 패턴을 발견해!
- 3깊을수록 더 똑똑해지는 마법의 구조
- 4딥러닝, 이제 AI가 스스로 배운다!
정의와 배경
확산 모델은 물리학의 확산(diffusion) 현상, 즉 잉크가 물속에 퍼지는 원리에서 착안한 생성 모델이다. 학습 단계에서는 원본 데이터(예: 이미지)에 단계적으로 무작위 노이즈를 더해 완전한 잡음 상태로 만드는 '순방향 확산 과정'을 정의하고, 모델은 이 과정을 역으로 되돌리는 '역방향 복원 과정'을 학습한다. 2020년대 초반 이후 GAN(생성적 적대 신경망) 등 기존 생성 모델의 한계를 극복하면서 주목받기 시작했으며, Stable Diffusion·DALL-E·Imagen 등 대표적인 이미지 생성 서비스의 핵심 기술로 활용되고 있다.
작동 원리와 종류
순방향 과정에서는 원본 데이터에 수백~수천 단계에 걸쳐 가우시안 노이즈를 누적 적용해 최종적으로 순수한 노이즈 분포에 도달하게 한다. 역방향 과정에서는 딥러닝 모델(주로 U-Net 구조)이 각 단계에서 추가된 노이즈를 예측·제거하는 방법을 학습하며, 추론 시에는 무작위 노이즈에서 시작해 이 과정을 반복함으로써 새로운 데이터를 생성한다.
대표적인 유형으로는 DDPM(Denoising Diffusion Probabilistic Model), 노이즈 제거 단계를 대폭 줄여 생성 속도를 높인 DDIM(Denoising Diffusion Implicit Model), 그리고 텍스트 조건을 결합한 잠재 확산 모델(Latent Diffusion Model) 등이 있다. 잠재 확산 모델은 픽셀 공간이 아닌 압축된 잠재 공간에서 확산 과정을 수행해 연산 효율을 크게 개선한 방식으로, Stable Diffusion이 이 방식을 채택한 대표 사례다.
타 생성 모델과의 비교 및 특징
기존 생성 모델인 GAN은 생성자와 판별자가 경쟁하는 구조로 학습 불안정성과 모드 붕괴(mode collapse) 문제가 있었으나, 확산 모델은 노이즈 예측이라는 단순하고 안정적인 목표 함수로 학습해 이러한 문제를 상당 부분 해소했다. 다양성과 품질 면에서 우수한 결과를 산출하며, 텍스트·클래스·이미지 등 다양한 조건(condition)을 결합한 조건부 생성에도 유연하게 적용된다.
다만 수백~수천 단계의 반복 연산이 필요해 GAN 대비 생성 속도가 느리다는 단점이 있으며, 이를 극복하기 위한 단계 수 감소 및 가속 기법 연구가 지속되고 있다.
정책·산업적 시사점
확산 모델은 이미지·영상·음악·3D 객체 생성 등 창작 산업 전반에 걸쳐 생산성 혁신을 이끌고 있으며, 의료 영상 합성·신약 분자 설계·위성 데이터 증강 등 전문 분야에서도 활용 범위가 확대되고 있다. 정부 및 공공기관 입장에서는 딥페이크·저작권 침해·허위정보 생성 등 부작용에 대한 규제와 탐지 기술 마련이 중요한 과제로 부상하고 있다. 아울러 고품질 학습 데이터의 확보, 대규모 GPU 연산 자원, 그리고 모델 경량화 기술이 확산 모델의 실용적 도입을 위한 핵심 인프라 요소로 꼽힌다.
※ 본 상세 설명은 용어집 데이터를 토대로 AI가 생성했습니다. 정확한 내용은 원문 출처를 우선하세요.