Две парадигмы
Роботы давно варят кузова точнее человека, но сложить футболку научились только недавно. Правила, которые пишет инженер, перестают работать в открытом мире, а нейросеть, обученная на примерах, требует много данных и ошибается молча. В этом уроке ты сравнишь оба подхода на одной задаче, найдёшь, где отказывает каждый, и увидишь, почему дальше курс идёт по пути данных.
Пишем правила
Инженер раскладывает задачу на модули и пишет для каждого понятный код.
# восприятие if r > 0.60 and g < 0.35 and b < 0.35: cup = centroid(pixels) # планирование и управление path = astar(hand, cup, obstacles) v = pid(path.next - hand)
Показываем примеры
Оператор много раз проводит руку Ады к чашке, а нейросеть учится повторять. Вот настоящие демонстрации из этого урока:
Ада
Ада — домашний гуманоидный робот, общий для всех лабораторных работ курса. Её среда — упрощённая квартира: кухня, коридор, две спальни. В каждом уроке Ада решает одну задачу, которая стоит и перед настоящими домашними роботами: довести руку до чашки, проехать по коридору до кухни, определить, в какой она комнате. На одной и той же задаче мы сравниваем разные методы, классические и обучаемые.
Модель упрощена: сцены двумерные, физика и датчики сведены к тому, что важно для темы урока. Но принципы те же, что у реальных роботов: у датчиков есть шум, у моторов — ограничения по моменту и скорости, а нейросети в лабораторных настоящие и обучаются прямо в браузере. Имя — в честь Ады Лавлейс.
Сварить кузов проще, чем сложить футболку
Роботы полвека точно варят кузова, а сложить футболку надёжно научились только недавно, хотя с этим справляется любой подросток. В 1961 году на заводе General Motors заработал Unimate — первый промышленный робот. Сегодня манипуляторы варят кузова с точностью до долей миллиметра, круглосуточно и почти без брака.
Почему так, заметил Ганс Моравек ещё в 1988 году: то, что людям даётся без усилий, — видеть, хватать, ходить, — для машины оказывается самым трудным. Шахматы и расчёты даются компьютеру легко, а восприятие и моторика уровня годовалого ребёнка — нет. Это называют парадоксом Моравека.
Заводского робота программируют: движения задают заранее, а детали всегда лежат на своих местах. Мир подстроен под робота, и правил хватает. Дома мир под робота не подстроишь: ткань каждый раз ложится по-новому, и все случаи заранее не опишешь.
Поэтому вместо правил роботу всё чаще дают примеры и обучают на них нейросеть. В конце 2024 года Physical Intelligence показала модель π0, которая достаёт бельё из сушилки и складывает его. Манипуляторы, которыми она управляет, мало отличаются от манипуляторов десятилетней давности; изменилась система управления.
Итак, поведение робота можно получить двумя способами: инженер пишет правила, или нейросеть обучается на примерах. Чем различаются системы управления, построенные этими способами?
Как устроена система управления робота
Разницу проще всего увидеть на одной задаче. Возьмём ту, что пройдёт через весь урок: Ада стоит у кухонного стола, камера смотрит на стол сверху, нужно довести руку до чашки.
Правила раскладывают задачу на модули: восприятие находит чашку, оценка состояния уточняет, где она, планировщик строит путь, регулятор ведёт руку. Каждый модуль пишет инженер. Подход на данных заменяет всю цепочку одной нейросетью: оператор много раз проводит руку к чашке, и сеть учится переводить пиксели камеры прямо в команды моторам. Это end-to-end. Между ними есть гибриды, а самые новые системы устроены в два уровня. Переключай архитектуры и нажимай на блоки.
Правила: сильные и слабые стороны
- Гарантии. Планировщик обходит замеченное препятствие по построению, устойчивость регулятора доказывается математически.
- Частота и точность. Контуры управления работают на сотнях и тысячах герц.
- Прозрачность. Каждый модуль тестируется отдельно, отказ виден на конкретном стыке.
- Открытый мир. Правило «красное — значит чашка» живёт, пока чашки красные и свет дневной. Каждая новая ситуация требует нового правила, а ситуаций бесконечно много. Это называют длинным хвостом.
Обучение на данных: сильные и слабые стороны
- Обобщение. Сеть сама находит признаки, которые инженер не догадался бы запрограммировать.
- Нет ручных стыков. Вся система оптимизируется под конечную цель, информация не теряется между модулями. В опорной работе урока (Levine et al., 2016) робот вставлял блок в сортер в 96% попыток, а модульный вариант с отдельной оценкой позы — ни разу: ошибка в сантиметр на стыке убивала задачу с миллиметровым допуском.
- Голод по данным. Сотни примеров даже для простой задачи, тысячи часов — для универсальной модели.
- Нет гарантий и тихие отказы. За пределами данных сеть ведёт себя непредсказуемо и не сообщает об ошибке.
Похожий переход уже случился с текстом: обработка языка ушла от правил к большим языковым моделям. Но у языковых моделей был интернет, а у роботов его нет. Как это ограничение обходят, разберём в части 4.
На бумаге правила дают гарантии и прозрачность, но не справляются с открытым миром. Данные дают обобщение, но требуют много примеров и ошибаются молча. Где на деле отказывает каждый подход?
Три версии Ады, одна задача
Где на деле отказывает каждый подход? Списки плюсов и минусов этого не скажут: нужно поставить подходы рядом и менять условия по одному.
Три версии Ады — на правилах, end-to-end и гибрид — получают одинаковые руки и одну кухню. Нейросети обучаются прямо сейчас в твоём браузере на 200 демонстрациях: это настоящие сети, а не анимация. В пяти экспериментах условия меняются по одному: свет, препятствие на пути, цвет чашки. Перед каждым сделай прогноз, кто дойдёт до чашки.
Предметы и стартовую точку руки можно перетаскивать мышкой — даже во время движения.
Что видит камера
Что видит каждая архитектура
Для Ады стол — это 256 цветных пикселей. Версия на правилах смотрит на них через правила, которые написал инженер. Нейросеть сама выучила, куда смотреть: ниже — её карты внимания. Чем темнее клетка, тем больше веса у этого пикселя при вычислении «точки интереса».
Громкие и тихие отказы: статистика вместо одной сцены
Одна сцена может обмануть. Прогони 40 случайных сцен в текущих условиях и посмотри, как ошибается каждая версия.
В литературе по надёжности такие отказы называют signaled и unsignaled. Мы для краткости говорим «громкий» и «тихий».
Каждый подход отказал в своём сценарии. Правила не нашли чашку вечером и не узнали бирюзовую, но оба раза остановились и сообщили об отказе. End-to-end сеть врезалась в чайник и уверенно поехала к миске вместо бирюзовой чашки. Гибрид справился с вечером и чайником, но бирюзовую чашку тоже спутал с миской. Можно ли исправить эти отказы и во что это обойдётся каждому подходу?
Исправление отказов: правила против данных
Как исправить отказы из лаборатории 1? У подходов разные инструменты. Правила исправляют правилами: инженер видит отказ и дописывает код. Нейросеть исправляют данными: оператор записывает новые демонстрации, и сеть переобучают.
Пройди оба пути на одной Аде и сравни, что исправляет каждый и во что это обходится. В карточке «Путь правил» добавляй исправления, в карточке «Путь данных» меняй число и разнообразие демонстраций и обучай сети заново. Изменения сразу применяются к Аде из лаборатории 1.
Путь правил
Правила восприятия, которые инженер написал днём. Добавь исправления для отказов из лаборатории 1.
Путь данных
Сколько демонстраций записал оператор и насколько они разнообразны? На этих данных обучаются обе нейросети: end-to-end политика и восприятие гибрида.
Успех в зависимости от числа демонстраций
Каждая точка — один запуск обучения и проверка на 40 новых сценах. Классике данные не нужны — её уровень задают правила.
Последняя модель во всех условиях
Доля сцен из 40, где Ада дошла до чашки.
Оба пути исправляют только то, что предусмотрели заранее. Правило дёшево, но закрывает один случай, а случаев бесконечно много. К тому же правила начинают мешать друг другу: баланс белого исправляет вечер, но усиливает шум и нарушает работу детектора чайника. Данные дороги: каждая демонстрация — это время оператора. Зато они покрывают сразу множество вариаций, которые никто не перечислял, — если эти вариации попали в демонстрации.
Заметь, как мало данных нужно гибриду: его нейросеть учит только «где чашка», а не всё поведение целиком. Промежуточная разметка экономит данные. Большие модели используют ту же идею по-другому: сначала учатся на огромных общих данных, а потом им хватает немногих примеров для нового навыка (часть 3).
У каждого пути своя цена. Так какой подход выбрать?
Цена каждого подхода
Чтобы выбрать подход, сведём наблюдения из двух лабораторий в одну таблицу. В последнем столбце — где это было видно.
| Свойство | Правила | End-to-end | Гибрид | Где это было видно |
|---|---|---|---|---|
| Обобщение на новые условия | каждое — новым правилом | если условия покрыты данными | за счёт нейросетевого восприятия | Лаб. 1 «Вечер», Лаб. 2 |
| Гарантии и безопасность | следуют из алгоритма | нет, только статистика | за счёт классических модулей | Лаб. 1 «Чайник на пути» |
| Отлаживаемость | видно, какой модуль ошибся | «чёрный ящик» | видно, но восприятие непрозрачно | «Мысли» робота, статистика отказов |
| Характер отказов | чаще громкие | тихие и уверенные | тихие, если ошиблось восприятие | Лаб. 1 «Бирюзовая чашка», статистика отказов |
| Потребность в данных | почти не нужны | сотни демонстраций | в разы меньше, чем end-to-end | Лаб. 2 |
| Ошибки на стыках модулей | копятся: каждый модуль оптимизирует своё | стыков нет, всё учится под цель | стыков меньше | Раздел 2 |
Как делят работу. Ни один подход не выигрывает во всём. Нейросетям отдают то, что правилами не описать: восприятие открытого мира, язык, мягкие предметы. Правила оставляют там, где нужны гарантии, частота и точность: ограничения скорости, зоны безопасности, аварийная остановка. Как применить это к конкретным задачам?
Заблуждение: «end-to-end всегда лучше, дело только в данных». Гарантии не появляются от данных. Сеть, которая объезжает чайник в 99 случаях из 100, в сотом может въехать в него, и об этом никто не узнает заранее.
Заблуждение: «VLA управляет моторами напрямую». Модели «зрение — язык — действие» выдают цели несколько десятков раз в секунду, а моторы держат регуляторы на килогерце. Граница сдвигается: в 2026 году и нижний слой у некоторых роботов стал нейросетевым. Подробно — в уроке 0.3 и в части 6.
Кому что доверить в доме Ады
Проверим правило «нейросетям — открытый мир, правилам — гарантии» на конкретных задачах. Разложи 12 задач из дома Ады по трём корзинам. Для каждой спроси себя, что здесь важнее: восприятие открытого мира и ловкость или жёсткие гарантии. Перетаскивай карточки или нажми на карточку, а потом на корзину.
Нейросеть
восприятие, язык, открытый мир, мягкие и сыпучие предметы
Нейросеть со страховкой
нейросеть понимает ситуацию, правило гарантирует безопасность
Правила
известная среда, жёсткие гарантии, обычный код
Как подходы сочетают в 2026 году
Настоящие роботы делят работу так же: систем только на правилах или только на данных в продуктах почти не бывает. Вот примерное положение известных роботов: чем правее, тем больше поведения выучено. Нажми на точку.
Даже у самых end-to-end систем на нижнем уровне обычно работают классические регуляторы. Сеть выдаёт целевые положения суставов десятки раз в секунду, а контур управления мотором отрабатывает их на сотнях и тысячах герц.
Реальные системы сочетают оба подхода, но граница сдвигается в сторону данных. С каждым поколением обучаемая часть растёт: сначала нейросети забрали восприятие, потом планирование, теперь и управление движением. Почему индустрия ставит на данные, хотя у них столько слабостей?
Почему дальше курс идёт по пути данных
Индустрия ставит на данные, потому что правила не масштабируются. Правило на каждую ситуацию не напишешь: на кухне бесконечно много чашек, света и беспорядка. В этот длинный хвост и упёрлась версия Ады на правилах: каждое исправление закрывало один случай и тянуло за собой следующий.
Данные масштабируются иначе: чтобы научить сеть новому, не нужно заранее знать, как устроен мир, — нужно показать достаточно примеров. Поэтому дальше курс идёт по пути данных, а классику достаём, когда без неё не обойтись.
Главным ограничением стали сами данные, и индустрия собирает их в небывалых для робототехники объёмах. π0 в 2024 году обучали на 10 000+ часов демонстраций на роботах. GEN-0 в 2025-м — уже на 270 000 часов, но это записи того, как работают руками люди, снятые носимыми устройствами.
До текстов, на которых учатся языковые модели, всё равно далеко: Кен Голдберг назвал это отставание «разрывом в 100 000 лет». Оценка грубая, он сам называет её мысленным экспериментом, но порядок разрыва она передаёт верно. Как его сокращают — телеоперацией, видео людей, симуляцией и данными с работающих роботов, — разберём в части 4.
Шесть вопросов о типичных заблуждениях
Итоги урока
- Правила — модули с понятными интерфейсами: гарантии, частота, прозрачность. Слабость — открытый мир и длинный хвост ситуаций.
- Обучение на данных — сеть сама находит признаки и обобщает. Слабость — голод по данным и тихие отказы: сеть не знает, что ошиблась.
- Сеть обобщает только то, что покрыто данными. Важно не только количество примеров, но и их разнообразие.
- Современные системы — двухуровневые нейросетевые модели со страховкой из правил. Обучаемая часть растёт с каждым поколением.
- Главное ограничение — данные. Поэтому дальше курс идёт по пути данных и разбирает, как их добывают и как на них учат.
Задание
Эссе на одну страницу. Выбери реальный продукт: гуманоида, складского робота или робота-пылесоса. Разбери его стек: какие части обучаются, какие запрограммированы и почему именно так. Опирайся на таблицу компромиссов из этого урока.
Материалы
- π0: наша первая универсальная политикаPhysical Intelligence, 2024 — видео со складыванием белья
- Good old-fashioned engineering can close the 100,000-year “data gap” in roboticsK. Goldberg, Science Robotics, 2025
- End-to-End Training of Deep Visuomotor PoliciesS. Levine, C. Finn, T. Darrell, P. Abbeel, 2016 — опорная работа урока и прообраз сети из лаборатории 1
- Open X-EmbodimentПопытка собрать общий датасет роботов: более миллиона траекторий, 22 типа роботов
- Robotic ManipulationR. Tedrake, MIT — классика и обучение в манипуляции
Дальше: устройство робота. В этом уроке у Ады было идеальное тело: сеть выдавала команду, и захват сразу сдвигался ровно туда, куда она велела. У настоящего робота команду исполняют моторы с редукторами и регуляторы, а о себе и о мире он узнаёт по шумным сенсорам, каждый со своей частотой. Что на самом деле получает и выдаёт политика и чем она управляет — урок 0.2.
Карта курса
Девять частей. Нажми на станцию — увидишь, какой вопрос из этого урока там раскрывается.