ruDALL-E — нейросеть «Сбера», генерирующая изображения по описанию
«Сбер» представил нейросеть ruDALL-E, которая создаёт изображения по описанию. К слову, это первая нейросеть, которая работает с запросами на русском языке, и это самый масштабный вычислительный проект в России и СНГ.
ruDALL-E обучается одновременно на картинках и текстах. Создавать можно неограниченное количество изображений, но нужно ждать: сейчас запрос обрабатывается порядка 30 минут из-за наплыва желающих.
Сгенерированные изображения по запросу «очень красивая собака». Источник: ruDALL-E
Всего задействуется три нейросети: первая анализирует запрос и генерирует заданное число изображений, вторая выбирает самые удачные картинки, а третья увеличивает их размер без потери качества.
Все модели доступны на GitHub и скоро появятся на платформе ML Space.
«Пирожные с красными ягодами». Источник: ruDALL-E
Нейросеть на английском была представлена в начале года. Её разработали в OpenAI. Команды SberDevices, Sber AI и SberCloud воспроизвели код и запустили обучение модели на платформе ML Space. На это потребовалось 23 тысячи GPU-часов с использованием 120 млн пар текст-изображение.
«Сбер» представил обновлённую версию нейросети Kandinsky для генерации изображений по текстовому запросу Статьи редакции
Она умеет также смешивать несколько картинок или создавать изображение на основе другого.
- Kandinsky 2.1 — улучшенная версия одноимённой нейросети, которую «Сбер» представил в июне 2022 года. Это уже не первое обновление, версию Kandinsky 2.0 показали в ноябре 2022-го.
- Воспользоваться ею можно на сайте, при помощи команды «Запусти художника» на «умных» устройствах Sber, в приложении «Салют», на платформах ML Space и Fusion Brain, а также в Telegram-боте.
- Модель дополнительно обучили на 170 млн пар «текст — изображение», а затем дообучали на отдельно собранном датасете из 2 млн пар изображений. В Kandinsky 2.0 было 2 млрд параметров, в Kandinsky 2.1 — 3,3 млрд.
- Нейросеть также усовершенствовали за счёт новой обученной модели автоэнкодера (автокодировщик; нейросеть, которая сначала кодирует входные данные, а потом декодирует их в другом виде — прим. vc.ru), которая используется в том числе в качестве декодера векторных представлений изображений. Это улучшило генерацию изображений в высоком разрешении — лиц и других сложных объектов.
- Kandinsky 2.1 может создавать изображения по текстовому описанию. Также она умеет изменять их по текстовому запросу, смешивать несколько рисунков, дорисовывать недостающие части, генерировать изображения, похожие на заданное и другое. Кроме этого, она использует для генерации специальное представление картинки от CLIP — классификатора изображений от OpenAI.
- Нейросеть понимает запросы на 101 языке — включая русский и английский. Обучали модель исследователи Sber AI и учёные из Института искусственного интеллекта AIRI на объединённом датасете Sber AI и SberDevices.
А вот так ИИ рисует сам Сбер
У меня вот так получилось. Где у них руки?
Это только подтверждает насколько нейросеть крутая, как тонко она чувствует это дерьмо
Побаловался с сеткой. Мне кажется достойный результат.
Я бы так точно не нарисовал.
С этим срочно нужно что-то делать©️
Сберыч как всегда, раньше он заставлял стоять в очереди в своих отделениях, а теперь заставляет стоять в очереди за изображениями. Хоть что-то не меняется никогда.
Уровень обслуживания, кстати, тоже на уровне. Спасибо ещё нах..й не послал.
Клиенты Сбербанка благодарят банк за работу
Вот где счёт открывали, там и генерируйте свои картинки!
Герман Греф любит клиентов банка
На стене зашифровано слово "Опер". Кажется нейросеть пытается нам что-то сказать.
А в каком стиле картинку заказывали?
А чего это буквы все английские выдает?))
И вот так уже пять минут. Дафак?
Попробовал) не смог дождаться результата
пробовал пару недель назад в Кандинском сгенерировать картинку по описанию, показывало что надо подождать несколько часов
с нынешним наплывом ожидание будет наверное несколько недель
У меня через бота в тг 11 минут ушло
Такая же херня, скам походу
Талон в службу поддержки брали?
Сбер превратился в конторку шарлатанов. Девсы просто берут открытый код, год сидят нихрена не делают и потом впаривают это лоху Грефу, как разработку.
Маск, перелогинься. Опять твои шуточки про: "прогеры ниче не делают")) В твиттере это с тобой злую шутку уже сыграло, и еще сыграет.
На фоне мирового ИИ пиздеца, меркнет новость, но в целом, по картинкам, качество генерации ниче так
Если конечно не постановка, одна удачная картинка из тысячи
Не хуже Dall-E 2. Но до MidJourney все таки не дотягивает. На четверочку поработали.
чет ощущение, что кандинский ваш ник принял за описание шофера
просто его звали дядя Богдан
Насчитал 15 зубов верхнего ряда в улыбке
А руки то загребущие
Греф в маске Буша?)
7 пальцев + запасной, норм комплектация
Сатана печет блины
Звучит как отличное название для панк группы.
А вот что мне нарисовала другая нейронка по запросу "лучший и добрейший сбербанк"
Жена с утра не накрасилась
срочно, сгенерируйте "драка либералов и ботов на VC "
А что — vc.ru ещё и в печатном виде выходит?
В некоторых кабинетах, да.
И комменты в распечатках
Рептилоиды в естественной среде обитания )
Чебурашка и крокодил Гена
Надеялся, что хоть отечественная нейронка смотрела наши мультики. %)
Все зависло, не получилось попробовать (
нагрузочное провалено.
нужна новая статья, когда пофиксят
Так, а что тут от сбера? Clip и Dalle
котиков норм генерит
Ждём нейросеть Кавински, которая нарисует, как Райян Гослинг не умер в конце Драйва
жму, минут 5 крутит колёсико и затем ничего не появляется
чтобы рисовать абстракцию — особого ума не надо :)) (вспомнился фильм 1+1) :))
А чё эт иноагентом Кандинским назвались, тут уж надо кого-то из соцреализма
Похоже придется топать в отделение
Ого, значит теперь можно даже по СМС заказать шедевр от Кандинского?
Нихера она не умеет. Все попытки загрузить и как то изменить исходное изображение привели ни к чему.
Хоть где-то ещё можно пожить в идеальном мире, спасибо технарям создавшим ИИ. Сначала были говорилки у костра и люди ценили больше тех кто был рядом, потом появились почтовые голуби и люди переключили внимание на дальних собеседников, затем пришёл интернет и люди стали общаться с ИИ обманывая себя красивыми фантиками которые он создаёт.
Мы расплачиваемся временем, коэффициент полезности которого может свести к нулю всё 30000 дней жизни. Потому что раньше люди мерились мозгами, а сейчас тешат своё самолюбие иишными картинками, в погоне за всемирным вниманием. Натуральный мир уходит в прошлое, вымирает как мамонт и перегоревших лампочек становится больше.
Случился хабраэффект от читателей VC =)
Кстати, кто-нибудь в курсе, что с авторскими правами при использовании сгенерированных ИИ картинок в блоге, на сайтах или ещё где-нибудь? Результаты генераций вообще хранятся у создателей ИИ? Смогут они потом сопоставить и что-то предъявить, если увидят "свою" картинку на чужом сайте?
Юридически все сложно, т.к. diffusion модели создают новые изображения и это не прямое копирование. А Midjourney разрешает продавать сгенерированное в платных аккаунтах.
3 раза пытался создать "Крепкие и нежные объятия", все 3 раза минут 5 ждал и оставался без картинки:(
Kandinsky 2.1: как российская нейросеть генерирует изображения

Kandinsky 2.1 — это третье обновление нейросети Kandinsky для генерации изображений, представленное в апреле 2023 года. Проект разработала команда исследователей Sber AI при поддержке ученых из Института искусственного интеллекта AIRI. С помощью Kandinsky 2.1 можно создавать визуал для блога или соцсетей, решать конкретные бизнес-задачи, связанные с дизайном, рекламой и маркетингом.
Все самые удивительные примеры, когда искусственный интеллект создает высококачественное фотореалистичное изображение по текстовому запросу, выполнены диффузионными моделями нейросетей. Kandinsky 2.1 — первая и единственная диффузионная модель, созданная в России, которая понимает сотню языков [1]. Она работает аналогично нейросетям Midjourney, Stable Diffusion и DALL-E 2. Диффузионные модели — подкатегория глубоких генеративных моделей, которые сначала размывают изображение, а потом пытаются его восстановить, генерируя тем самым данные, аналогичные тем, на которых они обучаются [2].

Если сравнивать Kandinsky 2.1 со своим предшественником — Kandinsky 2.0, то здесь существенно увеличено количество параметров (с 2 млрд до 3,3 млрд). Кроме того, эту модель дополнительно обучили на 170 млн пар «текст — изображение». По словам разработчиков, теперь модель создает еще более реалистичные и детализированные изображения, в которых качественно переданы различные тени, отражения и текстуры [3].
Всего за четыре дня после запуска сервиса Kandinsky 2.1 привлек 1 млн уникальных пользователей. Это превосходит показатели нашумевшей нейросети ChatGPT от OpenAI, которой потребовалось на это пять дней. За первые двое суток пользователи сгенерировали свыше 1,3 млн изображений. Самые популярные запросы первых дней — кот, любовь и космос. Также пользователи часто загружают шедевры живописи, чтобы создать их вариации [4].

Что умеет нейросеть Kandinsky 2.1
У Kandinsky 2.1 есть четыре режима работы:
Генерация по тексту
Например, вы можете написать «Средиземное море», выбрать стилистику «anime» и получить готовое изображение в заданной теме и стилистике.

Смешивание картинок
Вы можете загрузить две картинки и посмотреть, какой микс вам сделает Kandinsky 2.1. РБК Тренды попробовали объединить мемы «умиляющийся кот» и «упоротый лис».
Смешивание картинки и текста
Вы добавляете картинку и пишете слова, которые подскажут нейросети, что с ней делать. РБК Тренды попросили сервис смешать фотографию американского музыканта Принса с текстом «икона».
Вариации картинки
Этот инструмент позволяет сделать уникальную вариацию на базе исходного изображения. РБК Тренды загрузили картину Казимира Малевича «Голова крестьянина».
В Сбере создали нейросеть Kandinsky 2.1: она понимает русский язык и генерирует изображения в пару кликов
Text2image нейросети — это уже не просто модная игрушка, но и полезный инструмент для бизнеса. В Сбере обновили нейросеть Kandinsky, которая помогает создателям контента быстро генерировать изображения на разные темы, в разных стилях, под разные задачи.
Как устроена Kandinsky 2.1
Под капотом у Kandinsky 2.1 уникальная архитектура, которая позволяет создавать визуал на уровне лучших мировых нейросетей и так называемых перспективных технологий (state-of-the-art, SoTA).
Вот основные преимущества Kandinsky 2.1:
- Нейросеть работает по принципу text2image: вводите текстовый запрос или загружаете картинку, а ИИ сгенерирует, дорисует или объединит изображения по вашему описанию.
- Это первая и единственная в России диффузионная нейросеть, которая понимает больше 100 языков. Конечно, можно писать запросы и на русском.
- Воспользоваться нейросетью можно бесплатно и без регистрации на сайте.
Кому и когда может быть полезна нейросеть
Kandinsky 2.1 пригодится двум группам пользователей:
- Профессиональные контент-мейкеры. Например, дизайнеры и иллюстраторы.
- Непрофессиональные контент-мейкеры. Например, блогеры и преподаватели.
Нейросеть поможет создавать визуал не только для того, чтобы удивить друзей или подписчиков в соцсетях, но и для решения конкретной бизнес-задачи. Например, чтобы создать визуальный ряд для рекламы нового товара или придумать дизайн для будущих визиток.
В первую очередь Kandinsky 2.1 — это технологический помощник, которому креаторы делегируют рутину. Это пример сотворчества, когда любой человек может почувствовать себя творцом, а нейросеть становится подручным инструментом и помогает быстро и легко реализовывать гениальные идеи.
Вот такое изображение мы получили от Kandinsky 2.1 по запросу «Старинная улица в центре Москвы, полная туристов»
Как использовать Kandinsky 2.1
Интерфейс платформы интуитивно понятен и прост в использовании: просто вводите текстовый запрос и нажимайте кнопку «Создать».

Если у вас есть пожелания по стилю изображения, их можно прописать текстом или выбрать в специальном разделе. Пользователям доступно 20+ стилей: от аниме и советского мультфильма до хохломы и рисунка карандашом. Также можно выбрать стиль конкретного художника.

Придумать хороший промт и сгенерировать максимально подходящее изображение вам поможет эта инструкция.
- Выберите ключевой объект. Например, «кот», «машина», «стул». Если хотите объединить объекты используйте дефис: «кот-машина», «стул-колбаса». Учитывайте, что чем несовместимее два существительных, тем хуже получится генерация.
- Опишите объект прилагательными. Укажите размер, настроение, цвет, текстуру. Например, «грустный кот», «милый бегемот с бантиком», «веселый ребенок». Желательно использовать не больше 2-3 прилагательных.
- Определите, где объект должен находиться. Это могут быть небо, комната, берег реки. Желательно что-то максимально простое: «машина, дорога». Если конкретное место не хочется, можно добавить просто фон. Например, «медведь на белом фоне».
- Добавьте дополнительные элементы. Лучше что-то реальное: мячики, игрушки, листья, дом. Не стоит писать много элементов, иначе нейросеть сосредоточится на них и плохо проработает основной объект.
- Используйте эффектыдля красочности. Например, «туман», «зеленое сияние», «блестки», «искры», «мрачность», «луч света», «зернистость», «блюр». Выбор огромный и зависит от вашей цели и фантазии.
- Выберите стиль. Здесь все просто: «жираф в стиле детского рисунка», «смартфон в стиле Дали», «самолет в стиле киберпанка». Лайфхак: выбирайте стиль, который гарантированно подходит вашей композиции и подчеркнет ее.
Где тестировать нейросеть
Есть несколько способов оценить возможности Kandinsky 2.1:
- на платформе Fusion Brain;
- на промо-странице модели;
- при помощи команды «Запусти художника» на умных устройствах Sber и в мобильном приложении «Салют»;
- на платформе ML Space в хабе предобученных моделей и датасетов DataHub; .
Чтобы начать экспериментировать, переходите на сайт и создавайте изображения в пару кликов. Это просто и бесплатно.