Kandinsky: российская нейросеть для генерации изображений и видео

Обзор нейросети Kandinsky от Сбера: история, версии, функционал, доступные платформы, советы по созданию промптов и ответы на частые вопросы.

Что такое Kandinsky и чем он отличается от зарубежных аналогов

Kandinsky — это нейросеть, разработанная компанией «Сбер» совместно с учёными Института искусственного интеллекта AIRI. Она предназначена для генерации изображений, анимации и видео по текстовому описанию. Название отсылает к художнику Василию Кандинскому, что символизирует сочетание технологий и творчества.

Главное отличие Kandinsky от таких зарубежных сервисов, как Midjourney или Stable Diffusion, — полная адаптация под русский язык и российский культурный контекст. Нейросеть понимает сложные формулировки, метафоры, падежи и культурные реалии, что делает её особенно удобной для русскоязычных пользователей. Кроме того, Kandinsky доступен бесплатно, в то время как многие зарубежные аналоги предлагают платные тарифы.

Ещё одна особенность — интеграция с экосистемой Сбера: доступ через приложение «СберБанк Онлайн», виртуального ассистента «Салют» и другие платформы. Это делает нейросеть доступной для широкой аудитории, включая тех, кто не знаком с современными ИИ-инструментами.

История развития: от ruDALL-E до Kandinsky 3.1

Первой моделью, ставшей прототипом Kandinsky, стала ruDALL-E XL, выпущенная в ноябре 2021 года. Она имела 1,3 млрд параметров и была доступна в открытом доступе. На её основе был создан сервис rudalle.

В июне 2022 года «Сбер» представил первую версию Kandinsky с 12 млрд параметров. Модель обучалась на 179 млн пар «текст-изображение» и генерировала изображения в три этапа: создание набора картинок, выбор наиболее подходящих с помощью алгоритма ruCLIP Large и увеличение разрешения.

В ноябре 2022 года вышла Kandinsky 2.0 с новой архитектурой Latent Diffusion и поддержкой 101 языка. В апреле 2023 года появилась версия 2.1, которая использовала улучшенные энкодеры и позволяла генерировать изображения 768×768 пикселей. За четыре дня после релиза нейросетью воспользовался миллион человек.

В июле 2023 года вышла Kandinsky 2.2 с поддержкой изображений до 1024×1024 пикселей, функцией ControlNet для локального редактирования и возможностью создавать прямоугольные изображения. В октябре того же года добавили генерацию 4-секундных анимаций.

В ноябре 2023 года была представлена Kandinsky 3.0, которая стала лучше понимать запросы и генерировать более фотореалистичные изображения. В апреле 2024 года вышла Kandinsky 3.1 с функцией улучшения промпта, уменьшенным количеством шагов генерации и возможностью использовать изображения в качестве входных данных.

Kandinsky Video: генерация видео по текстовому описанию

В ноябре 2023 года «Сбер» представил отдельную модель Kandinsky Video для создания видеороликов. Первая версия могла генерировать видео длительностью до 8 секунд с частотой 30 кадров в секунду и разрешением 512×512 пикселей. На одну генерацию уходило около 3 минут.

Модель состоит из двух частей: первая создаёт опорные кадры, вторая — интерполяционные, которые обеспечивают плавность движения. Для обучения использовался датасет из более чем 300 тысяч пар «текст-видео».

В апреле 2024 года вышла версия Kandinsky Video 1.1 с улучшенным качеством, а в декабре 2024 года — Kandinsky 4.0, которая поддерживает видео в формате HD длительностью до 12 секунд.

Стоит отметить, что качество видео пока уступает качеству изображений, а время генерации достаточно велико. Тем не менее, это первая российская модель такого рода, и она продолжает активно развиваться.

Функционал Kandinsky 3.1: что умеет нейросеть

Актуальная версия Kandinsky 3.1 предлагает широкий набор функций:

  • Генерация по текстовому промпту — создание изображений с нуля на основе описания.
  • Микширование изображения и текста — возможность дополнить существующее изображение элементами, описанными текстом.
  • Редактирование с помощью ControlNet — локальное изменение сгенерированного изображения без изменения всей сцены.
  • Микширование двух изображений — объединение двух картинок в одну.
  • Inpainting/outpainting — дорисовывание частей изображения или расширение его за пределы исходных границ.
  • Бьютификация промпта — автоматическое улучшение текстового запроса с помощью языковой модели Neural-Chat-v3-1.

Также доступны различные стили изображения (всего 17), возможность выбора соотношения сторон (1:1, 16:9, 9:16, 3:2, 2:3) и разрешения до 4K. Нейросеть поддерживает негативные промпты, позволяя исключать нежелательные элементы.

Где и как пользоваться Kandinsky: доступные платформы

Kandinsky доступен на нескольких платформах, что делает его удобным для разных категорий пользователей:

  • Сайт Fusion Brain — основной веб-интерфейс с интуитивным дизайном и горячими клавишами.
  • Сайт ruDALL-E — более ранний сервис, также поддерживающий генерацию.
  • Чат-бот в Telegram — позволяет генерировать изображения прямо в мессенджере.
  • Чат-бот в VK — аналогичный функционал для пользователей ВКонтакте.
  • Приложение «СберБанк Онлайн» — интеграция в банковское приложение.
  • Виртуальный ассистент «Салют» — в Android-приложении можно попросить «Салют» нарисовать картинку.
  • «Салют ТВ» — команда «Включи художника» на телевизорах с поддержкой Сбера.

Каждая платформа имеет свои особенности. Например, в Telegram-боте доступны только соотношения сторон 1:1, 16:9 и 9:16, а на сайте Fusion Brain — больше вариантов. Формат скачивания обычно JPEG, но для 3D-рендеров доступен PNG.

Как составить эффективный промпт для Kandinsky

Качество результата напрямую зависит от того, как составлен текстовый запрос. Вот несколько рекомендаций:

  • Начинайте с главного — сначала укажите, кто или что должно быть на картинке, затем действие, затем детали.
  • Добавляйте детали — фон, время суток, погода, цвета, настроение, крупность плана, стиль. Чем больше деталей, тем точнее результат.
  • Используйте простые конструкции — избегайте сложных предложений и деепричастных оборотов.
  • Избегайте метафор — лучше использовать прямые отсылки, например, «в стиле Малевича» или «как в фильме „Криминальное чтиво“».
  • Применяйте негативные промпты — чтобы исключить нежелательные элементы, например, «без ночи».
  • Подсматривайте чужие промпты — это помогает понять логику нейросети и сэкономить время.

Пример хорошего промпта: «Реалистичное фото, плёнка 35 мм, милая молодая девушка блондинка с длинными волосами ночью, большие глаза, пухлые губы, естественный макияж, белая майка, крупные серьги, ночные огни, портрет, максимум деталей».

Практические примеры: генерация картинок, анимации и видео

Рассмотрим несколько примеров использования Kandinsky в разных режимах.

Картинки. Для генерации изображения достаточно ввести промпт и нажать кнопку. Например, запрос «Мопс в короне сидит на троне, картина в стиле Веласкеса, максимум деталей» создаст забавный портрет в стиле старых мастеров. Нейросеть предлагает несколько вариантов, из которых можно выбрать лучший.

Анимация. Анимация создаётся из нескольких сцен (до четырёх), каждая длительностью 4 секунды. Можно задать направление движения камеры: зум, панорама и т.д. Например, для сцены «Пустыня, 4k» и «Солнце, 4k» получится ролик с переходом от пустыни к солнцу.

Видео. Kandinsky Video генерирует короткие ролики до 5 секунд. Пример промпта: «Молодой парень в белой футболке, джинсах и бейсболке едет на скейте по городу, на фоне парк аттракционов, снято на плёнку, кинематографичное видео». Время генерации — около 4 минут.

Важно помнить, что нейросеть может ошибаться, особенно при создании сложных сцен с несколькими персонажами. В таких случаях помогает уточнение промпта или использование ластика для удаления лишних деталей.

Ограничения и возможные проблемы

Несмотря на все преимущества, у Kandinsky есть ограничения, о которых стоит знать:

  • Качество видео пока ниже, чем у изображений, и максимальная длительность ограничена.
  • Время генерации может быть значительным: для картинки — около 2 минут, для анимации из четырёх сцен — до 10 минут, для видео — около 4 минут.
  • Галлюцинации — нейросеть иногда создаёт неожиданные или нереалистичные элементы, особенно при сложных запросах.
  • Негативные промпты работают только для изображений, но не для анимации и видео.
  • Технические сбои — на сайте Fusion Brain иногда возникают ошибки, требующие перезагрузки страницы.

Также стоит учитывать, что Kandinsky, как и другие нейросети, может неправильно интерпретировать запросы с несколькими объектами или действиями. В таких случаях рекомендуется упрощать формулировку или разбивать задачу на несколько этапов.

Сравнение Kandinsky с другими нейросетями

Kandinsky часто сравнивают с Midjourney и Stable Diffusion. По качеству изображений он находится примерно на одном уровне, но имеет ряд отличий:

  • Бесплатность — Kandinsky полностью бесплатен, в то время как Midjourney требует подписки.
  • Русскоязычная адаптация — Kandinsky лучше понимает русский язык и культурные особенности.
  • Интеграция с экосистемой Сбера — удобство использования для пользователей банковских сервисов.
  • Функционал — Kandinsky поддерживает генерацию видео, что есть не у всех конкурентов.

Однако у зарубежных аналогов могут быть более продвинутые алгоритмы и большее сообщество пользователей. Выбор зависит от конкретных задач и предпочтений.

Перспективы развития Kandinsky

«Сбер» активно развивает линейку Kandinsky. Судя по истории обновлений, можно ожидать дальнейшего улучшения качества изображений и видео, увеличения скорости генерации и расширения функционала. Например, версия 3.1 уже позволяет генерировать изображения в 10 раз быстрее благодаря модели Flash.

Также вероятно появление новых интеграций и платформ, а также улучшение понимания сложных запросов. Учитывая интерес пользователей и поддержку со стороны государства, Kandinsky имеет все шансы стать одним из ведущих инструментов для генерации контента в России.

Вопросы и ответы

Бесплатна ли нейросеть Kandinsky?

Да, Kandinsky полностью бесплатен. В отличие от многих зарубежных аналогов, таких как Midjourney, здесь нет платных тарифов. Вы можете генерировать неограниченное количество изображений, анимаций и видео без каких-либо затрат.

На каких языках понимает запросы Kandinsky?

Kandinsky 2.0 и более новые версии поддерживают более 100 языков, включая русский. Нейросеть хорошо понимает сложные формулировки, метафоры и культурные реалии, что делает её особенно удобной для русскоязычных пользователей.

Можно ли использовать Kandinsky для коммерческих проектов?

Да, Kandinsky можно использовать для коммерческих целей, например, для создания иллюстраций для брендов, рекламных материалов или контента для соцсетей. Однако стоит учитывать, что результаты генерации могут быть непредсказуемыми, поэтому для важных проектов рекомендуется тщательно проверять качество.

Какие форматы изображений поддерживает Kandinsky?

Обычно изображения сохраняются в формате JPEG, за исключением изображений, созданных в стиле «3D рендер», которые доступны в PNG. Также можно выбрать соотношение сторон: 1:1, 16:9, 9:16, 3:2, 2:3.

Как улучшить качество генерируемых изображений?

Чтобы получить более качественные изображения, старайтесь составлять подробные промпты, указывая детали, стиль, освещение и другие параметры. Используйте негативные промпты для исключения нежелательных элементов. Также можно воспользоваться функцией бьютификации промпта, которая автоматически улучшает запрос.

Почему Kandinsky иногда выдаёт странные результаты?

Как и любая нейросеть, Kandinsky может «галлюцинировать» — создавать неожиданные или нереалистичные элементы. Это связано с ограничениями модели и сложностью запроса. В таких случаях рекомендуется упростить промпт, добавить больше деталей или использовать ластик для удаления лишних объектов.

Можно ли редактировать уже сгенерированные изображения?

Да, в Kandinsky 3.1 доступна функция ControlNet, которая позволяет локально изменять изображение, не меняя всю сцену. Также есть инструмент «ластик» для удаления ненужных объектов и возможность дорисовывания (inpainting/outpainting).