Компания Figure привезла своего человекоподобного робота в тридцать чужих домов, где он раньше никогда не был, и он сразу начал работать: убирал игрушки, застилал постели, складывал бельё. Без дообучения под каждую квартиру, без предварительного сканирования комнат, без настройки под конкретные предметы.
Основатель Figure Бретт Аддок называет Helix 2.5 самым важным проектом в истории компании. Мы разобрали выпуск на нашем канале: смотреть разбор на YouTube. Ниже главное текстом и, что важнее, вывод для бизнеса, который работает уже сегодня.
Что такое обобщение и почему это перелом
В робототехнике есть понятие zero shot generalization: робот работает в ситуации, которой не было в его обучающих данных. Раньше схема была другая. Робота обучали в конкретном помещении на конкретных объектах, и он работал только там. Переезд на соседний участок означал новый сбор данных и новую настройку.
Helix 2.5 обучили один раз, и он работает в незнакомом доме. Видит новую комнату, новые вещи и сам решает, что делать. Figure называет это whole body generalization: под новую среду подстраивается всё тело робота, а не отдельный захват.
Что это значит: робототехника перестаёт быть проектной историей «настроим под ваш цех за полгода» и становится продуктом, который приезжает и работает.
Откуда взялись данные
Большие языковые модели взлетели, когда появился способ учить их на данных интернет-масштаба. У робототехники такого объёма не было, и Figure решила это в лоб: год назад запустила платформу Index, куда люди загружают видео своих обычных действий.
Сейчас в ней участвуют больше 90 тысяч человек в неделю, и каждую секунду добавляется около 35 минут человеческого опыта. Робот учится напрямую у людей, потому что человекоподобная механика движется примерно так же, как человек.
Figure провела честный эксперимент: обучила две одинаковые модели, одну с данными Index, другую без. Модель без Index в новых домах просто не справилась. Обобщение появилось только после добавления человеческого опыта.
Что это значит: ценность снова оказалась в данных о том, как работу делают люди. У любой компании такие данные уже есть, просто они не записаны.
Законы масштабирования дошли до железа
Самое важное в этом выпуске не про уборку. У языковых моделей есть свойство: удваиваешь данные и вычисления, качество растёт предсказуемо. Figure обнаружила то же самое для роботов: при каждом удвоении данных предсказание следующего действия улучшалось по предсказуемой кривой.
Более того, финальную точность модели они смогли предсказать до четвёртого знака ещё до старта обучения. В компанию вкладывается 3,5 миллиарда долларов вычислений под эту задачу.
Что это значит: вопрос перешёл из «получится ли вообще» в «сколько данных и вычислений нужно». Это всегда означает быстрый и довольно скучный прогресс, к которому можно готовиться заранее.
Что из этого следует для обычной компании
Домашняя уборка тут наименее интересная часть. Если робот обобщает на разные дома, он обобщит и на разные участки одного склада или цеха. Коммерческих планов Figure пока не объявляла, но архитектура уже работает, а конкуренты идут следом.
Три практических шага, которые имеет смысл сделать не «когда роботы приедут», а сейчас:
1. Провести инвентаризацию повторяющихся физических задач: что в вашей компании делают руками каждый день и по одному и тому же сценарию.
2. Разделить их на два типа: там, где нужна гибкость и реакция на нестандартную ситуацию, и там, где хватит узкого станка или конвейера. Роботы общего назначения нужны только для первого типа.
3. Начать записывать, как эту работу делают люди: порядок действий, решения, исключения. Это тот самый ресурс, который у Figure стоил года сбора данных.
Что делать: третий пункт важнее первых двух и не требует ни робота, ни бюджета.
Почему мы пишем об этом, а не только смотрим
Мы в Solaris занимаемся не только контентом. Мы проектируем и внедряем ИИ-системы в рабочие процессы компаний, и почти всегда упираемся ровно в то, о чём говорит Figure: у заказчика нет описанного процесса. Люди знают, как делать работу, но нигде это не записано, поэтому ни агент, ни робот научиться не могут.
Поэтому наше внедрение всегда начинается с одного процесса: мы описываем его словами вместе с командой, собираем под него агента, замеряем результат до и после и только потом масштабируем. Как это устроено, подробно на странице внедрения искусственного интеллекта.
Физическая сторона нам тоже не чужая. У семьи есть производственная база с механообработкой, мы ведём проект ЭГИДА по обнаружению беспилотников и работаем с ExoSkill, где экзоскелет усиливает человека на тяжёлой работе. Это ровно тот же разговор, что у Figure, только с другой стороны: не заменить человека роботом, а снять с него часть нагрузки уже сейчас, пока гуманоиды учатся складывать бельё.
И собственные разработки мы сначала обкатываем на себе. Наш YouTube-канал полностью ведёт ИИ-агент: он находит тему, пишет сценарий, озвучивает, монтирует, режет шортсы и загружает, а человек только смотрит готовое и говорит «ок». Этот выпуск про Figure он тоже собрал сам. Первый ролик для своего канала можно собрать бесплатно в кабинете агента.
Чему тут стоит поучиться
Главный урок Figure переносится на любую компанию без роботов. Сначала данные о том, как работают люди, потом модель, потом масштаб. Компании, которые начали записывать свои процессы сегодня, получат работающего помощника быстрее тех, кто ждёт готового решения.
Если хотите разобраться в этом на практике, у нас есть бесплатная Академия Solaris: там мы собираем агентов, пишем для них базы знаний и регламенты и разбираем автоматизацию на живых задачах.
Частые вопросы
Что такое Helix 2.5 и чем он отличается от прошлых роботов?
Это модель управления человекоподобным роботом Figure, которая работает в незнакомых помещениях без дообучения. Раньше робота обучали под конкретную среду, и вне её он не работал.
Что такое zero shot generalization простыми словами?
Способность справиться с ситуацией, которой не было в обучающих данных. Для робота это значит приехать в новый дом или на новый участок склада и начать работать сразу.
Откуда Figure берёт данные для обучения робота?
С платформы Index, куда люди загружают видео своих действий. В ней участвуют более 90 тысяч человек в неделю, каждую секунду добавляется около 35 минут человеческого опыта. Контрольный эксперимент показал, что без этих данных обобщение не появляется.
Когда человекоподобные роботы придут в бизнес?
Коммерческих сроков Figure не называла. Но законы масштабирования для роботов уже подтверждены, а значит прогресс станет предсказуемым. Разумный горизонт подготовки это ближайшие несколько лет, а не десятилетия.
Что сделать компании уже сегодня?
Составить список повторяющихся физических задач, отделить те, где нужна гибкость, и начать записывать, как эту работу выполняют люди. Описанный процесс это то, из чего потом учится и агент, и робот.
