Gemini внутри роботов: зачем Google Deep Mind учит ИИ управлять машинами

Что общего у гуманоида на заводе, манипулятора на складе и робота-помощника в лаборатории? С точки зрения инженера — почти ничего: разная механика, разные сенсоры, разное ПО. А вот в планах Google Deep Mind у них может быть один и тот же «мозг» — модель Gemini. Именно об этом пишет Scientific American: компания продвигает идею «физического ИИ» и проверяет, выживет ли её интеллект за пределами дата-центра, в реальном мире, где предметы падают, руки дрожат, а дети и кошки ведут себя непредсказуемо.

Звучит как очередная красивая презентация? Возможно. Но за ней стоит довольно конкретная инженерная ставка, и она может изменить то, как мы представляем себе роботов. Давайте разбираться без хайпа.

Один мозг — много тел: в чём суть затеи

Классический робот — это набор узких навыков. Он умеет брать конкретную деталь с конкретного места и класть её в конкретный лоток. Поменяйте деталь, освещение или угол — и он растеряется. Причина в том, что его поведение прописано заранее: инженеры буквально описали каждое движение.

Подход Deep Mind другой. Модель вроде Gemini Robotics сначала учится на огромных массивах текста, изображений и видео — то есть понимает мир в широком смысле. А потом её дообучают на данных о движениях: как выглядит захват чашки, как открывается дверь, как складывается футболка. В итоге робот получает не список команд, а некое подобие общего понимания задачи.

Ключевая мысль: одно и то же ядро можно ставить на разное «железо». Гуманоид, рука-манипулятор, мобильная платформа — все они становятся просто разными телами для одной модели. Как сообщает Scientific American, компания хочет, чтобы Gemini питал энергией самые разные машины, а не один конкретный прототип.

Согласитесь, звучит амбициозно. Но есть нюанс: между «модель понимает слово стакан» и «робот аккуратно ставит стакан на край стола, не разлив воду» лежит пропасть.

Что именно умеет «роботизированный» Gemini

Речь идёт о семействе моделей, которое Deep Mind развивает отдельно от обычного чат-бота. Если упростить, там два слоя:

  • Слой рассуждения. Модель смотрит на камеру, понимает обстановку и планирует: что взять, в каком порядке, что может помешать.
  • Слой действия. Та же логика превращается в конкретные движения моторов — с учётом массы объекта, трения, инерции.

На практике это выглядит так: вы говорите роботу человеческим языком «убери со стола всё, что может испачкаться», и он сам решает, что это значит. Чашка с кофе — да. Книга — нет. Мокрая тряпка — скорее да. Раньше такое требовало отдельной программы под каждую формулировку.

Отдельно разработчики подчёркивают способность реагировать на изменения «на лету». Если предмет поехал, если кто-то переставил коробку, если рука задела край стола — модель должна перестроиться, а не выдать ошибку и остановиться. Именно это качество отличает лабораторное демо от рабочего инструмента.

Почему это сложнее, чем кажется на видео

В роликах роботы выглядят ловкими. За кадром остаётся главная проблема физического ИИ — данные. Текста в интернете сколько угодно, а вот записей, как именно сотни разных рук берут сотни разных предметов, катастрофически мало. Собрать такой датасет дороже и дольше, чем обучить языковую модель.

Есть и второй барьер — задержка. Пока сигнал дойдёт до облака и вернётся обратно, стакан уже улетел на пол. Поэтому часть вычислений приходится держать прямо на борту робота, а это ограничения по железу, теплу и энергопотреблению.

Третий барьер — разрыв между симуляцией и реальностью. В виртуальной среде всё идеально: идеальные сенсоры, идеальные поверхности, никакой пыли. В цеху — вибрация, блики, сквозняк. Модель, которая блестяще прошла тесты в симуляторе, может растеряться от банального солнечного луча на объективе.

Как бы вы поступили на месте инженеров: гнаться за универсальностью или сначала довести до идеала одну узкую задачу?

С кем Deep Mind собирается это испытывать

Универсальная модель без партнёров — просто научная работа. Поэтому компания идёт к производителям «железа». Среди известных направлений — сотрудничество с создателями гуманоидов: например, с Apptronik и её платформой Apollo, а также работа с Boston Dynamics, чей Atlas давно стал символом динамичной робототехники.

Смысл партнёрств простой: Deep Mind даёт интеллект и обучение, производители — тело, приводы и доступ к реальным сценариям. Именно на стыке и выясняется, годится ли Gemini для чего-то большего, чем эффектное видео.

Если вам интересно следить за тем, как технологии выбираются из лабораторий в реальную жизнь, подписывайтесь на канал — дальше будет ещё много разборов без лишнего пафоса.

Ставка на «физический ИИ» — и почему все забегали

Deep Mind здесь не одинок. В гонку включились и стартапы вроде Figure и Physical Intelligence, и Nvidia со своей платформой для обучения человекоподобных роботов, и Tesla со своим Optimus. Крупные деньги пошли в сектор не потому, что роботы внезапно научились ходить, а потому что большие модели наконец дали надежду на переносимый навык.

Логика инвесторов понятна: если один и тот же ИИ можно поставить на множество машин, экономика меняется. Не нужно писать софт под каждого заказчика — достаточно обновить модель. Это уже не про железо, а про платформу, а платформы масштабируются куда быстрее.

Но есть и обратная сторона. Как только робот перестаёт быть запрограммированной машиной и начинает «соображать», к нему возникают вопросы, которых раньше не было.

Безопасность: самый неудобный вопрос

Когда манипулятор повторяет одно и то же движение, риск предсказуем: его можно огородить, рассчитать усилия, поставить аварийную кнопку. Когда модель принимает решения сама, предсказуемость падает. И речь не только о травмах — хотя и о них тоже. Речь о непонятных решениях: почему робот выбрал именно этот маршрут, почему отпустил объект, почему не остановился.

Именно поэтому в таких проектах много внимания уделяют ограничениям: модель может быть умной, но физические лимиты и правила безопасности задаются отдельно и жёстко. Умная голова — не замена тормозам.

По данным Scientific American, ключевая проверка сейчас в том, сохранится ли интеллект модели при переносе в реальные условия, где нет права на бесконечные попытки. Это, пожалуй, главный вопрос ко всей отрасли.

Что это значит для нас с вами

В ближайшие годы вряд ли стоит ждать робота-домработника, который сам разберёт шкаф. Слишком дорого, слишком сложно, слишком много крайних случаев. А вот склад, логистика, сборочная линия, опасные производства — там универсальные модели могут прижиться быстрее, потому что задачи повторяемы, а экономия на переобучении очевидна.

Есть и третья ниша, о которой говорят реже: помощь людям с ограниченной подвижностью и работа в местах, куда человека отправлять не хочется. Там универсальность не роскошь, а необходимость — потому что заранее не предскажешь, что понадобится роботу завтра.

Только не стоит путать демонстрацию с продуктом. Между эффектным роликом и серийной машиной, которая работает восемь часов без инженера рядом, обычно проходит несколько лет и несколько разочарований.

Итог: умное тело или умная голова?

История с Gemini для роботов — это попытка ответить на старый спор: важнее идеальное железо или идеальный алгоритм? Deep Mind явно ставит на второе, предлагая считать тело сменным, а интеллект — общим. Получится ли, покажет не пресс-релиз, а количество машин, которые реально выйдут на смену и не сломаются через неделю.

А вы бы хотели, чтобы у вашего робота-помощника был один универсальный «мозг» на все задачи? Или предпочли бы узкого специалиста, который делает одно дело, но идеально? Поделитесь своим мнением в комментариях!

Если статья оказалась полезной, поддержите автора донатом.

Чтобы не пропустить новые публикации, подписывайтесь на канал.

Материал подготовлен на основе информации из открытых источников. Все права на исходные материалы принадлежат их авторам. Если вы являетесь правообладателем и возражаете против использования, свяжитесь с нами по адресу info@11st.press.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *