Компания Google DeepMind анонсировала обновлённые версии моделей для генерации изображений и видео: Nano Banana 2 Lite и Gemini Omni Flash. Презентация состоялась 30 июня в рамках внутреннего мероприятия для разработчиков.
Google расширяет линейку инструментов для работы с мультимедийным контентом, делая акцент на скорости и доступности. Nano Banana 2 Lite позиционируется как облегчённая версия модели для генерации изображений, оптимизированная для работы на устройствах с ограниченными вычислительными ресурсами. В свою очередь, Gemini Omni Flash предназначена для обработки видео в режиме реального времени и ведения диалогов на основе видеопотока.
По словам Пейдж Бейли (Paige Bailey), ведущего разработчика Google DeepMind, новые модели демонстрируют «значительный прирост производительности» по сравнению с предыдущими версиями. В частности, Gemini Omni Flash способна обрабатывать до 30 кадров в секунду при разрешении 1080p, что позволяет использовать её в приложениях для видеоконференций и стриминга. Nano Banana 2 Lite, как утверждается, потребляет на 40% меньше памяти, чем предшественник, при сохранении качества генерации.
Анонс вызвал интерес среди разработчиков и исследователей в области искусственного интеллекта. Филипп Шмид (Philipp Schmid), технический директор Hugging Face, отметил в своём посте, что «облегчённые модели Google могут стать стандартом для edge-устройств». Однако некоторые эксперты, включая Алекса Волкова (Alex Volkov), инженера по ИИ, высказали сомнения в готовности технологий к массовому внедрению из-за потенциальных проблем с точностью и стабильностью работы.
Подробности о технических характеристиках и возможностях интеграции моделей пока не раскрываются. Ожидается, что Google опубликует документацию и примеры использования в ближайшие недели.