Google DeepMind разрабатывает нейросети, которые закрывают почти все творческие и технические задачи: от ответов на текстовые вопросы до создания видео с озвучкой. В этом обзоре — 28 моделей, которые можно попробовать и встроить в свои проекты. Большинство из них доступно по API, а две имеют открытые веса, что расширяет возможности их применения.
28 нейросетей в подборке

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России

Google DeepMind, США
Открывается из России
Под выбранные условия не подошёл ни один нейросеть. Снимите часть отметок — счётчик рядом с каждым значением показывает, сколько карточек за ним стоит.
Семейство Gemini работает с текстом, изображениями, видео и аудио: среди них есть универсальные чат-модели, помощники для программирования и исследовательские агенты. Модели Veo отвечают за генерацию видео, а Nano Banana — за создание и редактирование изображений.
Отдельные линейки решают более узкие задачи: Lyria генерирует музыку по текстовому описанию, Gemini Embedding превращает данные в векторные представления для аналитики, а Gemini Deep Research создаёт отчёты по запросу. Такое разнообразие позволяет подобрать модель под конкретную задачу.
Линейка Gemini включает несколько поколений и модификаций, которые различаются по скорости, сложности задач и стоимости. Версии Flash — это быстрые модели для повседневных сценариев: они отвечают на вопросы, обрабатывают тексты и изображения без задержек.
Версии Pro предназначены для решения более сложных задач, включая программирование и анализ больших объёмов данных, но работают медленнее. Обозначение Lite указывает на облегчённые версии, которые требуют меньше ресурсов при схожих базовых возможностях.
Почти все модели DeepMind умеют работать с несколькими типами данных одновременно. Например, Gemini 2.5 Flash и Gemini 3.5 Pro принимают на вход текст, изображения, видео и аудио, а старшие версии Pro дополнительно анализируют код.
Специализированные модели обрабатывают более узкие наборы: Nano Banana понимает текст и изображения, Veo — видео, текст и изображения, а Gemini Deep Research и Gemini Embedding работают только с текстом. Разные версии одного поколения могут отличаться по набору поддерживаемых данных: так, Gemini 3.1 Flash-Lite не понимает код, в отличие от Gemini 3.1 Pro.
Для программистов предназначены модели с поддержкой кода: это Gemini 2.5 Pro, Gemini 2.0 Pro, Gemini 3 Pro, а также Flash-версии — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash. Они умеют писать фрагменты кода, объяснять его работу, находить ошибки и предлагать оптимизации.
Наиболее полные возможности дают модели Pro, но для быстрых подсказок и рефакторинга подойдут и Flash-версии. При выборе стоит учитывать, что чем сложнее задача, тем больше ресурсов требуется модели — и это влияет на скорость ответа.
Nano Banana — семейство моделей для создания изображений по текстовому описанию. Базовые версии Nano Banana и Nano Banana 2 Lite генерируют картинки с нуля, а Nano Banana 2 и Nano Banana Pro дополнительно умеют редактировать уже готовые изображения.
Модели понимают текст и изображения на входе, что позволяет описывать желаемую сцену словами или давать образец для стилизации. Это делает их полезными для дизайнеров, маркетологов и всех, кому нужно быстро получить визуал.
Veo 3.1 и Veo 3.1 Lite создают видеоролики по текстовому описанию и могут использовать изображения для наглядности. Обе модели поддерживают видео, текст и изображения на входе, что позволяет задавать сценарий и ключевые кадры.
Gemini Omni Flash — отдельная модель для генерации видео с текстовым сопровождением и звуком. Она объединяет видео- и аудиосинтез одного описания.
Большинство моделей Google DeepMind доступно через API, что позволяет интегрировать их в приложения и сервисы. Для части моделей, например Gemma 3, открыты веса — такие модели можно запускать на собственном оборудовании без ограничений вендора.
Выбор между API и открытыми весами зависит от задач: API проще подключить и он не требует мощного GPU, а открытые веса дают свободу в настройке и обеспечивают приватность данных. Все модели, перечисленные в этом обзоре, работают из России.
Начните с задач, которые нужно решить: для текстовых ответов и мультимодального анализа подойдут Gemini Flash, для программирования — Pro-версии, для генерации изображений и видео — Nano Banana и Veo. Если нужна интеграция в продукт, выбирайте API, а для экспериментов — Gemma 3 с открытыми весами.
Тестируйте модели на своих данных и сравнивайте их по скорости, качеству и стоимости. Помните, что для мощных моделей нужно приличное железо.
