Modern Robotics и Physical AIУрок 0.1 · Две парадигмы
0.1 Часть 0 · Введение

Две парадигмы

Роботы давно варят кузова точнее человека, но сложить футболку научились только недавно. Правила, которые пишет инженер, перестают работать в открытом мире, а нейросеть, обученная на примерах, требует много данных и ошибается молча. В этом уроке ты сравнишь оба подхода на одной задаче, найдёшь, где отказывает каждый, и увидишь, почему дальше курс идёт по пути данных.

≈ 40 минут2 лаборатории и 5 интерактивовбез формул
Парадигма 1

Пишем правила

Инженер раскладывает задачу на модули и пишет для каждого понятный код.

# восприятие
if r > 0.60 and g < 0.35 and b < 0.35:
    cup = centroid(pixels)
# планирование и управление
path = astar(hand, cup, obstacles)
v = pid(path.next - hand)
или
Парадигма 2

Показываем примеры

Оператор много раз проводит руку Ады к чашке, а нейросеть учится повторять. Вот настоящие демонстрации из этого урока:

Ада

Ада — домашний гуманоидный робот, общий для всех лабораторных работ курса. Её среда — упрощённая квартира: кухня, коридор, две спальни. В каждом уроке Ада решает одну задачу, которая стоит и перед настоящими домашними роботами: довести руку до чашки, проехать по коридору до кухни, определить, в какой она комнате. На одной и той же задаче мы сравниваем разные методы, классические и обучаемые.

Модель упрощена: сцены двумерные, физика и датчики сведены к тому, что важно для темы урока. Но принципы те же, что у реальных роботов: у датчиков есть шум, у моторов — ограничения по моменту и скорости, а нейросети в лабораторных настоящие и обучаются прямо в браузере. Имя — в честь Ады Лавлейс.

СХЕМАЧетыре архитектуры управления: от модульного стека до двухуровневой VLA
ЛАБ. 1Три версии Ады на одной кухне: найди, где отказывает каждая
ЛАБ. 2Исправь отказы правилами и данными и сравни, во что обходится каждое исправление
ЗАДАЧИРеши, что в доме Ады доверить нейросети, а что — правилам
СПЕКТРКак подходы сочетают в реальных системах 2026 года

Начать урок ↓

1 Парадокс

Сварить кузов проще, чем сложить футболку

Роботы полвека точно варят кузова, а сложить футболку надёжно научились только недавно, хотя с этим справляется любой подросток. В 1961 году на заводе General Motors заработал Unimate — первый промышленный робот. Сегодня манипуляторы варят кузова с точностью до долей миллиметра, круглосуточно и почти без брака.

Почему так, заметил Ганс Моравек ещё в 1988 году: то, что людям даётся без усилий, — видеть, хватать, ходить, — для машины оказывается самым трудным. Шахматы и расчёты даются компьютеру легко, а восприятие и моторика уровня годовалого ребёнка — нет. Это называют парадоксом Моравека.

Заводского робота программируют: движения задают заранее, а детали всегда лежат на своих местах. Мир подстроен под робота, и правил хватает. Дома мир под робота не подстроишь: ткань каждый раз ложится по-новому, и все случаи заранее не опишешь.

Поэтому вместо правил роботу всё чаще дают примеры и обучают на них нейросеть. В конце 2024 года Physical Intelligence показала модель π0, которая достаёт бельё из сушилки и складывает его. Манипуляторы, которыми она управляет, мало отличаются от манипуляторов десятилетней давности; изменилась система управления.

Итак, поведение робота можно получить двумя способами: инженер пишет правила, или нейросеть обучается на примерах. Чем различаются системы управления, построенные этими способами?

2 Архитектуры

Как устроена система управления робота

Разницу проще всего увидеть на одной задаче. Возьмём ту, что пройдёт через весь урок: Ада стоит у кухонного стола, камера смотрит на стол сверху, нужно довести руку до чашки.

Правила раскладывают задачу на модули: восприятие находит чашку, оценка состояния уточняет, где она, планировщик строит путь, регулятор ведёт руку. Каждый модуль пишет инженер. Подход на данных заменяет всю цепочку одной нейросетью: оператор много раз проводит руку к чашке, и сеть учится переводить пиксели камеры прямо в команды моторам. Это end-to-end. Между ними есть гибриды, а самые новые системы устроены в два уровня. Переключай архитектуры и нажимай на блоки.

Нажми на блок, чтобы узнать, что внутри

Правила: сильные и слабые стороны

  • Гарантии. Планировщик обходит замеченное препятствие по построению, устойчивость регулятора доказывается математически.
  • Частота и точность. Контуры управления работают на сотнях и тысячах герц.
  • Прозрачность. Каждый модуль тестируется отдельно, отказ виден на конкретном стыке.
  • Открытый мир. Правило «красное — значит чашка» живёт, пока чашки красные и свет дневной. Каждая новая ситуация требует нового правила, а ситуаций бесконечно много. Это называют длинным хвостом.

Обучение на данных: сильные и слабые стороны

  • Обобщение. Сеть сама находит признаки, которые инженер не догадался бы запрограммировать.
  • Нет ручных стыков. Вся система оптимизируется под конечную цель, информация не теряется между модулями. В опорной работе урока (Levine et al., 2016) робот вставлял блок в сортер в 96% попыток, а модульный вариант с отдельной оценкой позы — ни разу: ошибка в сантиметр на стыке убивала задачу с миллиметровым допуском.
  • Голод по данным. Сотни примеров даже для простой задачи, тысячи часов — для универсальной модели.
  • Нет гарантий и тихие отказы. За пределами данных сеть ведёт себя непредсказуемо и не сообщает об ошибке.

Похожий переход уже случился с текстом: обработка языка ушла от правил к большим языковым моделям. Но у языковых моделей был интернет, а у роботов его нет. Как это ограничение обходят, разберём в части 4.

На бумаге правила дают гарантии и прозрачность, но не справляются с открытым миром. Данные дают обобщение, но требуют много примеров и ошибаются молча. Где на деле отказывает каждый подход?

🔬 Лаборатория 1

Три версии Ады, одна задача

Где на деле отказывает каждый подход? Списки плюсов и минусов этого не скажут: нужно поставить подходы рядом и менять условия по одному.

Три версии Ады — на правилах, end-to-end и гибрид — получают одинаковые руки и одну кухню. Нейросети обучаются прямо сейчас в твоём браузере на 200 демонстрациях: это настоящие сети, а не анимация. В пяти экспериментах условия меняются по одному: свет, препятствие на пути, цвет чашки. Перед каждым сделай прогноз, кто дойдёт до чашки.

Правила
правила цвета → фильтр Калмана → планировщик A* → регулятор
⏸Готова к запуску
End-to-end
пиксели + положение руки → нейросеть → команда моторам
Обучаю нейросеть…
⏸Готова к запуску
Гибрид
нейросеть находит чашку → фильтр → A* → регулятор + монитор безопасности
Обучаю нейросеть…
⏸Готова к запуску
Условия: 📷 Шум камеры 0.02

Предметы и стартовую точку руки можно перетаскивать мышкой — даже во время движения.

Что видит камера

Что видит каждая архитектура

Для Ады стол — это 256 цветных пикселей. Версия на правилах смотрит на них через правила, которые написал инженер. Нейросеть сама выучила, куда смотреть: ниже — её карты внимания. Чем темнее клетка, тем больше веса у этого пикселя при вычислении «точки интереса».

Громкие и тихие отказы: статистика вместо одной сцены

Одна сцена может обмануть. Прогони 40 случайных сцен в текущих условиях и посмотри, как ошибается каждая версия.

В литературе по надёжности такие отказы называют signaled и unsignaled. Мы для краткости говорим «громкий» и «тихий».

Каждый подход отказал в своём сценарии. Правила не нашли чашку вечером и не узнали бирюзовую, но оба раза остановились и сообщили об отказе. End-to-end сеть врезалась в чайник и уверенно поехала к миске вместо бирюзовой чашки. Гибрид справился с вечером и чайником, но бирюзовую чашку тоже спутал с миской. Можно ли исправить эти отказы и во что это обойдётся каждому подходу?

🔬 Лаборатория 2

Исправление отказов: правила против данных

Как исправить отказы из лаборатории 1? У подходов разные инструменты. Правила исправляют правилами: инженер видит отказ и дописывает код. Нейросеть исправляют данными: оператор записывает новые демонстрации, и сеть переобучают.

Пройди оба пути на одной Аде и сравни, что исправляет каждый и во что это обходится. В карточке «Путь правил» добавляй исправления, в карточке «Путь данных» меняй число и разнообразие демонстраций и обучай сети заново. Изменения сразу применяются к Аде из лаборатории 1.

Путь правил

Правила восприятия, которые инженер написал днём. Добавь исправления для отказов из лаборатории 1.


        
4
строки правил
0 из ∞
исправлено случаев

Путь данных

Сколько демонстраций записал оператор и насколько они разнообразны? На этих данных обучаются обе нейросети: end-to-end политика и восприятие гибрида.

200

Успех в зависимости от числа демонстраций

Каждая точка — один запуск обучения и проверка на 40 новых сценах. Классике данные не нужны — её уровень задают правила.

Последняя модель во всех условиях

Доля сцен из 40, где Ада дошла до чашки.

⚖️

Оба пути исправляют только то, что предусмотрели заранее. Правило дёшево, но закрывает один случай, а случаев бесконечно много. К тому же правила начинают мешать друг другу: баланс белого исправляет вечер, но усиливает шум и нарушает работу детектора чайника. Данные дороги: каждая демонстрация — это время оператора. Зато они покрывают сразу множество вариаций, которые никто не перечислял, — если эти вариации попали в демонстрации.

Заметь, как мало данных нужно гибриду: его нейросеть учит только «где чашка», а не всё поведение целиком. Промежуточная разметка экономит данные. Большие модели используют ту же идею по-другому: сначала учатся на огромных общих данных, а потом им хватает немногих примеров для нового навыка (часть 3).

У каждого пути своя цена. Так какой подход выбрать?

3 Компромиссы

Цена каждого подхода

Чтобы выбрать подход, сведём наблюдения из двух лабораторий в одну таблицу. В последнем столбце — где это было видно.

СвойствоПравилаEnd-to-endГибридГде это было видно
Обобщение на новые условиякаждое — новым правиломесли условия покрыты даннымиза счёт нейросетевого восприятияЛаб. 1 «Вечер», Лаб. 2
Гарантии и безопасностьследуют из алгоритманет, только статистиказа счёт классических модулейЛаб. 1 «Чайник на пути»
Отлаживаемостьвидно, какой модуль ошибся«чёрный ящик»видно, но восприятие непрозрачно«Мысли» робота, статистика отказов
Характер отказовчаще громкиетихие и уверенныетихие, если ошиблось восприятиеЛаб. 1 «Бирюзовая чашка», статистика отказов
Потребность в данныхпочти не нужнысотни демонстрацийв разы меньше, чем end-to-endЛаб. 2
Ошибки на стыках модулейкопятся: каждый модуль оптимизирует своёстыков нет, всё учится под цельстыков меньшеРаздел 2
🧭

Как делят работу. Ни один подход не выигрывает во всём. Нейросетям отдают то, что правилами не описать: восприятие открытого мира, язык, мягкие предметы. Правила оставляют там, где нужны гарантии, частота и точность: ограничения скорости, зоны безопасности, аварийная остановка. Как применить это к конкретным задачам?

⚠️

Заблуждение: «end-to-end всегда лучше, дело только в данных». Гарантии не появляются от данных. Сеть, которая объезжает чайник в 99 случаях из 100, в сотом может въехать в него, и об этом никто не узнает заранее.

⚠️

Заблуждение: «VLA управляет моторами напрямую». Модели «зрение — язык — действие» выдают цели несколько десятков раз в секунду, а моторы держат регуляторы на килогерце. Граница сдвигается: в 2026 году и нижний слой у некоторых роботов стал нейросетевым. Подробно — в уроке 0.3 и в части 6.

🧩 Задачи

Кому что доверить в доме Ады

Проверим правило «нейросетям — открытый мир, правилам — гарантии» на конкретных задачах. Разложи 12 задач из дома Ады по трём корзинам. Для каждой спроси себя, что здесь важнее: восприятие открытого мира и ловкость или жёсткие гарантии. Перетаскивай карточки или нажми на карточку, а потом на корзину.

Нейросеть

восприятие, язык, открытый мир, мягкие и сыпучие предметы

Нейросеть со страховкой

нейросеть понимает ситуацию, правило гарантирует безопасность

Правила

известная среда, жёсткие гарантии, обычный код

4 Реальные системы

Как подходы сочетают в 2026 году

Настоящие роботы делят работу так же: систем только на правилах или только на данных в продуктах почти не бывает. Вот примерное положение известных роботов: чем правее, тем больше поведения выучено. Нажми на точку.

← всё запрограммировановсё выучено →
🔩

Даже у самых end-to-end систем на нижнем уровне обычно работают классические регуляторы. Сеть выдаёт целевые положения суставов десятки раз в секунду, а контур управления мотором отрабатывает их на сотнях и тысячах герц.

Реальные системы сочетают оба подхода, но граница сдвигается в сторону данных. С каждым поколением обучаемая часть растёт: сначала нейросети забрали восприятие, потом планирование, теперь и управление движением. Почему индустрия ставит на данные, хотя у них столько слабостей?

5 Дальше

Почему дальше курс идёт по пути данных

Индустрия ставит на данные, потому что правила не масштабируются. Правило на каждую ситуацию не напишешь: на кухне бесконечно много чашек, света и беспорядка. В этот длинный хвост и упёрлась версия Ады на правилах: каждое исправление закрывало один случай и тянуло за собой следующий.

Данные масштабируются иначе: чтобы научить сеть новому, не нужно заранее знать, как устроен мир, — нужно показать достаточно примеров. Поэтому дальше курс идёт по пути данных, а классику достаём, когда без неё не обойтись.

Главным ограничением стали сами данные, и индустрия собирает их в небывалых для робототехники объёмах. π0 в 2024 году обучали на 10 000+ часов демонстраций на роботах. GEN-0 в 2025-м — уже на 270 000 часов, но это записи того, как работают руками люди, снятые носимыми устройствами.

До текстов, на которых учатся языковые модели, всё равно далеко: Кен Голдберг назвал это отставание «разрывом в 100 000 лет». Оценка грубая, он сам называет её мысленным экспериментом, но порядок разрыва она передаёт верно. Как его сокращают — телеоперацией, видео людей, симуляцией и данными с работающих роботов, — разберём в части 4.

🧭

Что будет дальше. С части 1 начнётся основной путь курса: обучение по демонстрациям, большие модели, данные, обучение с подкреплением, гуманоиды и модели мира. Перед ним — уроки 0.2, 0.3 и 0.4: тело робота, управление движением, оценка состояния и планирование.

6 Проверь себя

Шесть вопросов о типичных заблуждениях

7 Итог

Итоги урока

  1. Правила — модули с понятными интерфейсами: гарантии, частота, прозрачность. Слабость — открытый мир и длинный хвост ситуаций.
  2. Обучение на данных — сеть сама находит признаки и обобщает. Слабость — голод по данным и тихие отказы: сеть не знает, что ошиблась.
  3. Сеть обобщает только то, что покрыто данными. Важно не только количество примеров, но и их разнообразие.
  4. Современные системы — двухуровневые нейросетевые модели со страховкой из правил. Обучаемая часть растёт с каждым поколением.
  5. Главное ограничение — данные. Поэтому дальше курс идёт по пути данных и разбирает, как их добывают и как на них учат.

Задание

Эссе на одну страницу. Выбери реальный продукт: гуманоида, складского робота или робота-пылесоса. Разбери его стек: какие части обучаются, какие запрограммированы и почему именно так. Опирайся на таблицу компромиссов из этого урока.

Материалы

➡️

Дальше: устройство робота. В этом уроке у Ады было идеальное тело: сеть выдавала команду, и захват сразу сдвигался ровно туда, куда она велела. У настоящего робота команду исполняют моторы с редукторами и регуляторы, а о себе и о мире он узнаёт по шумным сенсорам, каждый со своей частотой. Что на самом деле получает и выдаёт политика и чем она управляет — урок 0.2.

Карта курса

Девять частей. Нажми на станцию — увидишь, какой вопрос из этого урока там раскрывается.

Урок пригодился? Скажи спасибо — так автор узнает, что курс читают.