Диффузионная модель — это тип генеративной модели, которая учится создавать реалистичные изображения, звуки или другие данные, постепенно удаляя шум из случайного начального состояния. Процесс напоминает физическую диффузию, где частицы равномерно распределяются от области высокой концентрации к низкой. В контексте ИИ «шум» — это случайные искажения, а «очистка» — восстановление структуры.

Работает это так: модель сначала обучается добавлять шум к исходным данным (например, фотографиям), пока они не превратятся в случайный набор пикселей. Затем она осваивает обратный процесс — шаг за шагом убирает шум, восстанавливая осмысленное изображение. На практике это позволяет генерировать новые изображения из чистого шума, просто повторяя процесс «очистки» с разными начальными условиями.

Яркий пример — Stable Diffusion, который создаёт фотореалистичные картинки по текстовому описанию. Другой вариант — DALL·E от OpenAI, где диффузионные модели помогают редактировать изображения, изменяя только нужные части без полного пересоздания.

Такие модели важны, потому что они сочетают высокое качество генерации с относительной стабильностью обучения. В отличие от GAN, где две нейросети «соревнуются», диффузионные модели менее склонны к коллапсу — ситуации, когда генератор начинает выдавать однообразные результаты. Кроме того, их проще масштабировать для работы с разными типами данных: от музыки до 3D-объектов.