Разработка Google DeepMind и возможности нейросети Gemini Robotics 2
Лаборатория Google DeepMind анонсировала масштабное обновление линейки искусственного интеллекта для робототехники, представив модель Gemini Robotics 2. Новое решение формата Vision-Language-Action (VLA) способно напрямую преобразовывать текстовую информацию и визуальный поток данных в точные моторные команды. Forklog
В отличие от предыдущей версии технологии, ориентированной преимущественно на верхнюю часть корпуса, новая система управляет всем телом устройства. Модель позволяет полноразмерным гуманоидам и манипуляторам эффективно передвигаться, приседать, наклоняться, а также уверенно удерживать предметы в условиях ограниченного пространства. 3dnews
В ходе демонстрации возможностей гуманоидный робот Apptronik Apollo 2 под управлением ИИ-системы успешно находил заданные объекты, снимал бейсбольную перчатку с полки и взаимодействовал с лейкой. По заявлению разработчиков, алгоритм также поддерживает работу с кистями, имеющими до 22 степеней свободы, что позволяет выполнять сложные микроманипуляции вроде завязывания узлов или выкручивания лампочек.
Архитектура ER 2 и планирование многоступенчатых задач
Вместе с основной базовой моделью разработчики показали обновленный планировщик ER 2, который выполняет роль высокоуровневого аналитического центра. Он отвечает за построение сложной последовательности действий, мониторинг выполнения этапов и динамическое распределение нагрузки между несколькими устройствами.
Во время тестирования гуманоид Apollo 2 выступал в роли координатора, самостоятельно делегируя двурукому роботу задачи по сортировке и укладке инструментов в контейнер. Такая интеграция позволяет организовывать автономную командную работу техники на производстве и в быту.
Дополнительно была анонсирована локальная версия Gemini Robotics On-Device 2. Алгоритм функционирует полностью в автономном режиме без подключения к сети и способен адаптироваться к новому оборудованию, задействуя менее 200 примеров в процессе нескольких часов обучения.
Хронология развития робототехнических моделей Gemini
- Март 2025 года — презентация первого поколения моделей Gemini Robotics и Gemini Robotics-ER на базе архитектуры Gemini 2.0.
- Июль 2026 года — официальный анонс второго поколения систем Gemini Robotics 2, ER 2 и их локальной версии On-Device 2.
- Июль 2026 года — открытие частного доступа к Gemini Robotics 2 и развертывание модели ER 2 через интерфейсы Gemini API и Google AI Studio.
Доступность моделей для разработчиков
- Gemini Robotics 2 находится в режиме ограниченного частного просмотра для партнеров компании.
- Модель-планировщик ER 2 стала доступна широкому кругу разработчиков через Gemini API и платформу Google AI Studio.
- Автономная On-Device 2 проходит финальное тестирование среди доверенных интеграторов.
Частые вопросы
Что такое ИИ-модель Gemini Robotics 2 от Google DeepMind?
Это мультимодальная Vision-Language-Action (VLA) модель нового поколения, предназначенная для управления моторикой и движениями роботов различных форм-факторов. В отличие от предыдущих версий, система координирует действия всего тела робота — от перемещения и приседаний до микроманипуляций кистями с 22 степенями свободы.
Чем модель ER 2 отличается от базовой Gemini Robotics 2?
Модель ER 2 выступает высокоуровневым аналитическим центром («мозгом») для планирования многоступенчатых задач и оценки их выполнения. Она способна распределять нагрузку и координировать совместную работу нескольких разных роботов в единой экосистеме.
Как работает локальная версия Gemini Robotics On-Device 2?
Локальная модель функционирует полностью автономно на самом устройстве без подключения к интернету. Система способна адаптироваться к новому робототехническому оборудованию менее чем за 200 примеров в процессе нескольких часов обучения.