Лекция 17. Систематизация знаний и навыков — инженерная карта AI¶
Лекция 17 · 37 слайдов
Титул + хук: одно умение из всего курса¶
[медленно, прямо в зал]
Давайте я начну с провокации. Если бы я мог дать вам только одно умение из всего этого курса — каким бы оно было?
[пауза]
Не «уметь писать промпты». Не «знать, что такое трансформер». Не «уметь подключить ChatGPT через API». Всё это полезно. Но у каждого из этих навыков короткий срок жизни. Промпт-инжиниринг был горячей профессией в две тысячи двадцать третьем — а к две тысячи двадцать шестому модели переписывают плохие промпты сами.
[пауза 2 сек]
Одно умение, которое не устареет, — это умение сказать ИИ «нет». Точнее — умение сформулировать, в каких задачах AI не подходит. И это умение асимметрично ценное. Людей, которые могут запустить ChatGPT и собрать демо, — слишком много. А вот инженер, который посмотрит на чужой проект и за пятнадцать минут скажет «это не взлетит в продакшене, вот по каким причинам», — такой человек сберегает компании миллионы.
Этот человек — вы. После этого курса. И сегодня мы с вами соберём всё, что прошли за шестнадцать лекций, в одну карту.
Это и есть тема Лекции семнадцать. Финальной.
[Переход на s02]
Keystone: 2D-плоскость инженерной карты AI¶
[медленнее — это несущая ось]
Вот главный артефакт курса. Запомните эту картинку — мы с вами будем возвращаться к ней весь час.
Перед нами двумерная плоскость. Две оси.
Горизонтальная ось — применимость ИИ. Она отвечает на вопрос: нужен ли тут AI вообще? Слева — детерминированные не-AI инструменты: операционные исследования, классика. Справа — полный AI. И обратите внимание: высокое значение справа не значит «лучше». Оно значит «AI подходит». А слева — не «отсталость», а «классика выигрывает».
Вертикальная ось — лестница автономии, от нуля до пяти. Она отвечает на другой вопрос: сколько ему доверить? Внизу — человек делает всё. Наверху — полная автономия без человека.
[пауза]
И вот тут ключевая мысль, нам важно её зафиксировать сразу. Это две независимые оси. Можно иметь высокую применимость и низкую автономию: медицинская диагностика по снимкам — AI работает прекрасно, но всегда советует, а решает врач.
Две оси дают четыре квадранта. Верхний правый — зрелые истории успеха. Нижний правый — высокая применимость, но автономия прикручена регулятором; квадрант заполнен. Нижний левый — классика выигрывает. А верхний левый — низкая применимость при высокой автономии — это пустой и опасный квадрант. Зона предупреждения. Оказались там — стоп, перепроектируйте.
Вся лекция — про то, как пользоваться этой картой. Поехали.
[Переход на s03]
Раздел 1 (вступление раздела)¶
Начинаем с горизонтальной оси карты.
Когда AI применять, а когда — нет. Семь измеримых критериев.
Семь рабочих случаев, два провала — и всё про одно: как отличить задачу для AI от задачи, где AI не место.
Семь критериев как последовательные ворота¶
Семь критериев. Давайте сразу про главное правило их применения.
Это не балльный чек-лист. Мы не складываем очки. Критерии работают как последовательные ворота. Если хотя бы по одному вы получаете однозначное «нет» — задача не годится для полной автономии AI. Точка. Один «нет» — и всё.
[пауза]
Вот семь вопросов. Запишите их.
Первый. Среда закрытая или открытая? Есть быстрая обратная связь? Второй. Достаточно ли обучающих данных? И совпадают ли они с тем, что будет в эксплуатации? Третий. Задача повторяемая и объёмная — или штучная? Четвёртый. Какова цена ошибки и радиус разрушения? Пятый. Есть ли эталон, по которому проверять качество? Шестой. Нужна ли объяснимость и аудит? Седьмой. Окупается ли AI против лучшей классической альтернативы?
[пауза]
Семь вопросов. На новую задачу — пятнадцать-двадцать минут. И за эти двадцать минут вы сэкономите компании месяцы на неудачном пилоте.
Давайте мы с вами пройдём их по парам — потому что в жизни они работают в связке.
Критерии 1 + 2: закрытая петля и данные¶
Критерий первый — закрытая петля против открытой среды. Самый фундаментальный.
Закрытая петля — это когда результат виден быстро и однозначно, и среда не сопротивляется нарочно. Помните разработку ПО? Написал код — компилятор за секунды говорит, скомпилировалось или нет, тесты за минуты говорят, проходят. Открытая среда — наоборот: результат виден медленно или не виден, среда меняется сама, и случается то, чего в данных не было.
[пауза]
И вот канонический провал. Помните Zillow — скупку жилья по ML-оценке, iBuying? Модель обучили на ценах до пандемии; пришла волатильность двадцатого — модель перестала успевать. Итог: списание триста четыре миллиона долларов, закрытие подразделения, около двух тысяч человек из восьми под сокращение. Открытый рынок убил модель.
А теперь закрытая петля. Помните See & Spray от John Deere — зрение на тракторе, отличающее сорняк от культуры? Контролируемый ряд, чёткая картинка, быстрая обратная связь. Минус пятьдесят процентов гербицида: вместо примерно фунта на акр — полфунта. На пяти миллионах акров — но для масштаба это полпроцента от девятисот миллионов сельхозакров США.
Критерий второй — достаточно ли данных? И главное — совпадают ли они с реальностью эксплуатации. Помните Epic Sepsis — модель предсказания сепсиса? Тут метрика качества по шкале от нуля до единицы. Вендор обещал под ноль целых семьдесят шесть. Независимая проверка на тридцати восьми тысячах пациентов дала ноль шестьдесят три — почти случайность. Это не «семьдесят шесть процентов упали до шестидесяти трёх»; это качество модели рухнуло к подбрасыванию монеты. Урок: бенчмарк вендора — не ваша производительность. Перепроверяйте на своих данных.
Критерии 3 + 4: повторяемость и цена ошибки¶
Критерий третий — повторяемость и объём. Банальная экономика, которую вечно игнорируют. AI окупается, только если задача встречается часто.
Помните GitHub Copilot? Автодополнение кода. Это случается миллиарды раз в день. Двадцать с лишним миллионов платных пользователей. Цена одной ошибки — секунда, нажал Escape. Объём гигантский, цена ошибки крошечная — идеально для AI.
А вот противоположность: архитектурное решение для крупной системы. Раз в год-полтора, огромная цена ошибки, контекст не влезает ни в одну модель. Здесь AI не окупается. Здесь нужен сеньор.
[пауза]
Критерий четвёртый — цена ошибки и радиус разрушения. Вот этот критерий чаще всего недооценивают на старте.
Цена ошибки — что будет, если AI ошибётся? От «нажал Escape» до катастрофы. А радиус разрушения — это насколько широко расходятся последствия одного сбоя.
[понизить голос]
Помните CrowdStrike — июль две тысячи двадцать четвёртого? Система защиты компьютеров выпустила одно обновление с багом. Оно автоматически прилетело на восемь с половиной миллионов устройств за часы. Синий экран по всему миру. Delta отменила семь тысяч рейсов. Ущерб пострадавшим компаниям — пять с лишним миллиардов долларов.
[пауза]
Сравните: ошибка Copilot — один разработчик, откат за секунду. Ошибка CrowdStrike — восемь с половиной миллионов устройств, откат — ручная перезагрузка каждого. Разница на порядки. Эвристика инженера: высокая цена, помноженная на большой радиус, плюс медленное обнаружение, плюс медленный откат — не давайте AI действовать. Только советовать.
Критерии 5 + 6: эталон и объяснимость¶
Критерий пятый — есть ли эталон? Тут нам поможет лестница причинности Джудеи Перла из самой первой лекции. Три уровня.
Первый — ассоциация: «что обычно идёт вместе с чем». Корреляция. AI это умеет нативно. Второй — вмешательство: «что будет, если я сделаю вот так». Нужен контролируемый эксперимент. Третий — контрфактуальность: «что было бы, если бы этого не случилось». А вот это — территория человека. У модели нет доступа к гипотетическим мирам.
[пауза]
Помните Galactica от Meta? «AI для науки», запустили в ноябре двадцать второго. Через сорок восемь часов отозвали. Модель уверенно генерировала фейковые статьи с фейковыми авторами и фейковыми ссылками — всё формально правильное на вид. Почему? В науке эталон — это воспроизводимый эксперимент, а не красивый текст. Нет эталона — галлюцинации неизбежны.
Критерий шестой — объяснимость и аудит. Регуляторы по всему миру движутся к обязательной объяснимости. EU AI Act — закон вступил в силу в августе двадцать четвёртого, запреты заработали в феврале двадцать пятого, требования к высокорисковым системам — с августа двадцать шестого. Высокорисковое — медицина, найм, кредиты, инфраструктура — обязано объяснять решения.
Помните Apple Card, двадцать девятнадцатый? Вирусный твит о том, что мужу дали лимит в двадцать раз больше, чем жене с тем же доходом. Расследование штата Нью-Йорк в двадцать первом году сняло обвинение в умышленной дискриминации — пол даже не был признаком в модели. И всё равно репутация была разрушена. Урок не про предвзятость. Урок про объяснимость: чёрная коробка в регулируемой сфере убивает доверие, даже когда злого умысла нет.
Критерий 7: экономика против классики¶
Критерий седьмой — окупается ли AI против классической альтернативы. Самый игнорируемый. AI должен бить известную классику на деньгах.
Помните UPS ORION — оптимизацию маршрутов курьеров? С две тысячи третьего года. Триста-четыреста миллионов долларов экономии в год. И знаете что? Там нет ни одной нейросети. Это классические операционные исследования: целочисленное программирование, эвристики. Диспетчеры доверяют системе почти автоматически — но это доверие к детерминированному решателю с математическими гарантиями, а не к обучаемой модели.
[пауза]
Когда вендоры предлагали UPS «улучшить ORION глубоким обучением» — вопрос был один: на сколько процентов лучше? Ответ — пара процентов на узких подзадачах, а стоимость интеграции и поддержки эту выгоду съедала. UPS остался с классикой.
То же в процессном управлении. Помните MPC — управление с прогнозирующей моделью? Работает в нефтехимии и металлургии десятилетиями. Когда предлагают заменить его обучением с подкреплением — спрашиваем: на сколько лучше? Yokogawa показал первое промышленное применение в двадцать втором — улучшение на проценты в очень узкой задаче. Успех, но не вытеснение MPC.
[прямо в зал]
Урок седьмого критерия: измерьте базовую линию до старта. Сколько даёт классика? Какую дельту обещает AI? Окупит ли дельта всю инфраструктуру, мониторинг, риск устаревания модели? Если нет — отказ от AI не поражение. Это инженерное решение. И это, кстати, то, что отличает инженера от человека с хайпом в глазах.
Разобранный пример: AI для воды в ЖКХ¶
Давайте применим все семь критериев к задаче, которой в курсе не было. Это упражнение.
Сценарий. К вам приходит городская администрация. Вендор предлагает систему «AquaOptima» для оптимизации питьевой воды. Обещание: минус тридцать процентов потерь, экономия двадцать пять миллионов рублей в год, окупаемость восемнадцать месяцев. Глубокое обучение плюс автоматическое управление задвижками. Хотят шестимесячный пилот.
Идём по критериям — и сразу видим, что слабые места копятся гроздьями.
Сначала — три жёлтых флага подряд. Среда: водопровод частично закрытый, но потребление зависит от погоды, праздников, футбольного матча — полуоткрытая. Данные: счётчики есть десятилетиями, но утечки могли не фиксироваться, ремонты — в бумажных журналах; нужен аудит до пилота. Эталон: общий расход известен, скрытые утечки — нет. Три флага «осторожно» ещё до главного.
А главное вот.
[понизить голос]
Цена ошибки. Что будет, если AI закроет не ту задвижку? Район без воды на часы. Десятки тысяч жителей. Вот это — стоп для полной автоматизации. Задвижками управляет человек, точка.
[пауза]
Добавьте объяснимость — решения публичные, их оспаривают, чёрная коробка не пройдёт. И экономику: минус тридцать процентов — по сравнению с чем? С нулём или с классической EPANET? Нужно сравнение.
Вердикт. В шестимесячный пилот с полной автоматизацией не входим. Вместо этого: два месяца — аудит данных и база на EPANET. Четыре месяца — A/B-пилот: половина города с AI-советами, половина — только EPANET. Все действия — человек.
И заметьте главное: процедура одна и та же для любой задачи. Завтра предложат AI для энергопотребления цеха — применяете те же семь вопросов.
Раздел 2 (вступление раздела)¶
Мы разобрали семь критериев — это горизонтальная ось. Теперь поднимаемся на вторую ось.
Лестница автономии, от нуля до пяти. Сколько именно доверить AI.
Лестница автономии: полный показ¶
Шесть ступеней. Запомните их вместе со мной — это вертикальная ось нашей с вами карты.
L0 — без автоматизации. AI не задействован. Человек делает всё. И это не отсталость — многие задачи остаются тут осознанно: финальный расчёт прочности крыла самолёта с подписью аттестованного инженера, например.
L1 — advisory, советует. AI классифицирует, предсказывает, рекомендует. Но решает всегда человек. Это самый частый уровень зрелой промышленной эксплуатации. Большая часть AI в медицине и финансах живёт именно здесь — так задумано, а не от недоразвитости.
L2 — supervised, действует с подтверждением. AI выполняет действие, человек подтверждает каждое.
L3 — conditional, узкий домен. AI действует автономно, но только в строго очерченной области. Вышел за её границы — отдал управление человеку.
L4 — high, широкий домен. AI действует в широком диапазоне условий. Человек — на петле, наблюдает, изредка вмешивается.
[понизить голос]
L5 — full, везде и всегда без человека. Это теоретический предел. В две тысячи двадцать шестом году он практически недостижим ни в одной отрасли курса. Поэтому он наверху серый.
[пауза]
И ещё. Почему ступени дискретные, а не плавная шкала? Потому что между ними — реальные границы. Юридические: L1 разрешён везде, L4 в медицине — уже нет. Инженерные: переход с одной ступени на другую — это другая дисциплина, не «больше того же».
Маппинг локальных шкал¶
Главный научный результат этой лекции — сейчас мы с вами сведём все локальные шкалы курса в одну лестницу. Но с важной оговоркой.
Помните, в разработке ПО была лестница A-B-C-D: автодополнение, блок, целый pull request, инженер-агент. В авиакосмосе — L1 до L5. В заводской автоматизации — A0 до A3. Все три — это шкалы автономии, степени участия AI в действии. И они маппятся напрямую: автодополнение и A1 — это наш L1, инженер-агент и A3 — наш L4.
[пауза]
Но вот тонкость, нам важно её понять. Не все локальные шкалы курса — про автономию.
Помните логистику? Там была лестница из пяти уровней структурированности среды: контролируемый склад, полуструктурированная трасса, городская улица, последняя миля, чёрный лебедь. Это не автономия — это про среду, в которой AI работает. Ортогональная ось.
А помните кибербезопасность? «Видит — Решает — Действует». Это не автономия — это функциональная декомпозиция. И каждая из трёх функций может быть на своём уровне: «Видит» — на L3, «Решает» — на L1, «Действует» — вообще на правилах без AI.
И вот что отсюда следует практически. Когда вендор приходит и говорит «наш AI на уровне L3» — вы спрашиваете: «В какой нотации? Это про автономию, про среду или про функцию? Где формальное определение L3? Где регуляторное одобрение?» Эти три уточняющих вопроса отсеивают процентов восемьдесят маркетинговых заявлений.
L1 advisory: глубже¶
Остановимся на L1 — самой частой ступени. AI советует, человек решает.
Что AI делает на L1? Классифицирует — сепсис или нет, патология на снимке или норма, фрод или легитимная транзакция. Предсказывает — спрос, температуру реактора, время доставки. Рекомендует — строку кода, очерёдность снимков.
Примеры, которые мы прошли. Stripe Radar помечает подозрительную транзакцию — аналитик решает. Aidoc в медицине приоритизирует снимки — радиолог решает. Crop Wizard в агро отвечает фермеру со ссылками — фермер решает. Project Maven в разведке выделяет объекты на спутниковых снимках — аналитик решает.
[пауза]
Теперь — как подняться с L1 на L2? Четыре условия. Измерена базовая линия и улучшение от AI. Есть процедура контроля изменений. Готов откат. И ложные срабатывания приемлемы — потому что на L2 человек подтверждает каждое действие, а если AI часто ложно срабатывает, человек устаёт.
И сразу антипаттерн. Помните Klarna? Финтех в феврале двадцать четвёртого заявил, что AI заменил семьсот операторов. А через год — обратный найм. AI не справлялся с редкими сложными запросами. Урок: называть систему «советующей» нельзя, если по факту она действует без человека.
L2 supervised и L3 conditional¶
Две средние ступени.
L2 — supervised. AI действует, человек подтверждает каждое действие. Stripe Radar в режиме автоблокировки для явного фрода — заблокировал, команда видит и может разблокировать. Yokogawa в химии — AI крутит параметры реактора, оператор может вмешаться в любой момент.
[понизить голос]
И главный антипаттерн L2 — скучный человек в петле. Помните Uber в Темпе, двадцать восемнадцатый? Автономная машина, водитель безопасности в кресле. Видеорегистратор показал: в момент перед столкновением водитель смотрел в телефон. Погибла пешеход Элейн Херцберг. Урок жёсткий: L2 не работает, когда подтверждение — скучное и редкое. Человек физически не может часами внимательно следить за тем, что почти всегда правильно.
[пауза]
L3 — conditional. AI действует автономно, но только в строго очерченной области эксплуатации. Главное понятие тут — домен эксплуатации, ODD. Формальное определение: какая погода, какое время, какой район. И система должна знать, когда вышла за свои границы, и отказаться работать.
Помните Waymo? Робот-такси в конкретных районах Сан-Франциско и Финикса, без сильного дождя. Внутри своего домена работает прекрасно. За его пределами — не лезет.
А вот антипаттерн — расширение домена без проверки. Помните Cruise — другое робот-такси? Второго октября двадцать третьего после столкновения машина протащила пешехода двадцать футов, пытаясь съехать на обочину. Лицензию отозвали, а в декабре двадцать четвёртого GM закрыл подразделение полностью. Урок: домен расширяют постепенно, с проверкой на каждом шаге.
L4 high и L5 full¶
Верхние ступени.
L4 — high. AI действует автономно в широком диапазоне условий. Человек — на петле, не в каждом шаге. Помните складскую робототехнику — Symbotic, Amazon Sparrow? Миллионы операций в сутки, минимальное вмешательство человека. Waymo в широком домене. See & Spray на пяти миллионах акров — оператор мониторит, но не каждый кадр.
[пауза]
И снова антипаттерн — и мы его уже знаем. CrowdStrike. Широкий домен — восемь с половиной миллионов устройств — означает огромный радиус разрушения. И обновление прилетело без канареечного выпуска, без поэтапного раскатывания. Урок переворачивает интуицию: широкий домен требует более строгой дисциплины развёртывания, а не менее.
[понизить голос]
L5 — full. Везде и всегда без человека. Почему недостижим? Пять структурных блоков. Страховщики не страхуют L5. Регуляторы требуют человеческого надзора. События вне распределения структурно не лечатся — никакой объём данных не покроет всё будущее. Юридическая ответственность не определена. И экономика: L4 уже покрывает девяносто девять процентов реальных сценариев — тянуться к L5 дорого ради крошечной выгоды.
И этический блок. Помните дискуссию о смертоносных автономных системах оружия? Технически L5 для оружия возможен. Этически — нет. Это не технический предел, а человеческий выбор.
Антипаттерны на каждой ступени¶
Давайте мы с вами соберём антипаттерны вместе — по одному на каждую ступень. Это полностью про границы применимости.
[ритмично, перечисление]
На L1 — превышение роли. Klarna. AI назвали советующим, а он действовал. Итог — обратный найм.
На L2 — скучный человек в петле. Uber в Темпе. Погиб пешеход, потому что подтверждение было скучным и редким.
На L3 — расширение домена без проверки. Cruise. Протащил пешехода, лицензия отозвана, подразделение закрыто.
На L4 — действие без канарейки и отката. CrowdStrike. Широкий домен умножил каждую ошибку.
На L5 — этический и регуляторный блок. Дискуссия об автономном оружии. Технически возможно, этически запрещено.
[пауза]
И отдельный антипаттерн поперёк всех уровней — пропуск ступени. Компании пытаются прыгнуть с L1 сразу на L3-L4, минуя L2. Это никогда не работает. Почему? Потому что каждый переход — это другая инженерная дисциплина и месяцы или годы работы.
Цифры для масштаба. Путь от L1 до L4 в одной задаче — типично три-шесть лет. Waymo начала с гонки DARPA в две тысячи седьмом, а коммерческий L4 — в двадцать четвёртом. Семнадцать лет. Так что стартап, обещающий «L4 за два года», либо лукавит, либо просчитался.
Разобранный пример: AI для приёма экзаменов¶
Применим лестницу к ещё одной задаче не из курса.
Сценарий. Университет рассматривает AI-помощника для приёма экзаменов: проверяет ответы, ищет плагиат, выставляет предварительные оценки. Какой максимально допустимый уровень автономии?
Разбираем.
Цена ошибки — высокая. Несправедливая оценка, обвинение в плагиате, академический след на всю жизнь. Объяснимость — критическая: студент имеет право апеллировать, и нужно объяснить, почему AI решил, что это плагиат. Регуляторное окно — академические правила обычно требуют человека-экзаменатора. Эталон — для тестов есть, для эссе — частично.
[пауза]
Вердикт: максимум L1. Советует. AI читает ответы, ставит предварительную оценку, помечает возможный плагиат с объяснением и ссылками. Преподаватель видит этот пакет и принимает окончательное решение. Студент может оспорить — экспертиза человеческая.
А что нужно, чтобы поднять до L2, где AI выставляет, а преподаватель подтверждает партиями? Измерить базу: сколько ошибок делает преподаватель сейчас, сколько — AI на тестовой выборке. Если AI систематически точнее — тогда можно. Но с явным контролем изменений.
L3 и L4 для этой задачи — недопустимы. И по регулятору, и по этике. Студент имеет право на человеческое решение. Это типичная диагностика лестницы: каждое применение — это вопрос «какой максимум здесь можно, и почему».
Раздел 3 (вступление раздела)¶
Мы построили обе оси. Семь критериев — это горизонталь. Лестница — это вертикаль. Теперь у нас есть плоскость — пора заселять её точками.
Шестнадцать отраслей на одной карте. Сейчас мы их все нанесём.
Карта 16 отраслей: lead-in¶
Прежде чем наносить — давайте мы с вами посмотрим на шестнадцать отраслей курса все вместе.
[обвести рукой mini-grid]
Каждая из них поднимала свою локальную ось. Разработка ПО — лестницу A-B-C-D. Финансы — закрытый против открытого мира. Медицина — закрытые петли и человека в петле. Авиакосмос — петлю наблюдай-решай-действуй. Агро — лестницу АПК. Логистика — пять уровней структурированности среды. Кибербезопасность — «видит-решает-действует». Наука — лестницу научного цикла. Нефтегаз — матрицу два на два.
[пауза]
И когда вы видите их рядом, проступает одна вещь. Все эти оси — про одно. Про то, насколько AI берёт на себя действие, насколько среда ему это позволяет, и где проходит граница, за которой человек должен остаться в петле.
Шестнадцать лекций — это не список тем. Это шестнадцать угловых обзоров одной и той же задачи. Давайте теперь сведём их на одну плоскость.
Карта, набор 1: ПО, финансы, медицина, авиакосмос¶
Наносим первые четыре точки — по одной из каждого семейства курса.
Разработка ПО — верхний правый угол. Высокая применимость, высокая автономия. Почему? Код — это текст, модели в нём сильны. Компилятор даёт мгновенный эталон. Объём гигантский. Цена ошибки крошечная. Все критерии сходятся.
Финансы и ритейл — верхняя середина. Применимость средне-высокая: фрод в закрытом мире — высокая, а iBuying в открытом — низкая, Zillow это показал. Автономия средняя.
[пауза]
Медицина — а вот тут внимание. Нижний правый угол. Применимость по снимкам высокая. Но автономия прикручена к L1 — и не по технике, а по регулятору. FDA не разрешает AI ставить диагноз без врача. Это этическое и юридическое решение, не технологическое.
Авиакосмос — верхняя середина с ограниченным потолком. Наблюдение — высокая применимость. Действие — ограничено этикой и регулятором.
И уже на четырёх точках видна структура: смежное с IT — вверху справа, регулируемая медицина — внизу справа. Карта начинает говорить.
Карта, набор 2: CAD, креатив, агро, производство¶
Добавляем средний набор. И тут появляются двойственные отрасли.
CAD/CAM, инженерное проектирование — середина. Главный урок: «AI в проектировании» — это не одна категория, а шесть разных классов. Оптимизация геометрии — высокая применимость. А вот LLM-помощник для написания скриптов — точность сорок пять-шестьдесят три процента, ниже промышленного порога. Маркетинг их склеивает, а вы — различайте.
Креатив — верхняя середина, двойственный. Массовые ассеты — концепт-арт, фоновая музыка — высокая применимость. А подписная авторская работа — главный фильм режиссёра — низкая. И тут же риски: утечка прав, дипфейк-мошенничество.
[пауза, обвести разделение точки]
Агро — и вот яркая двойственность. Точка раздваивается. See & Spray — узкая, очерченная задача, закрытая петля — летит в верхний правый. А Monarch — автономный трактор в открытом поле — падает в верхний левый, в зону провала. Тридцать восемь процентов сокращений в январе двадцать пятого, около пятидесяти трёх человек из ста сорока на пике. Та же отрасль — два противоположных результата.
Производство — середина-низ. Тоже две физики: дискретное против процессного. Безопасные системы по нормативам — на L0, зрение на конвейере — выше. И тут же болото пилотов: девяносто пять процентов AI-пилотов не доходят до продакшена. Но об этом подробнее в четвёртом разделе.
Карта, набор 3: двойники, логистика, кибербез, наука, нефтегаз¶
Финальный набор. И самый показательный случай двойственности — логистика.
[обвести три точки]
Логистика — это три отчётливые точки одной отрасли, и каждая — в своём квадранте. Первая — складская робототехника: Symbotic, Amazon Sparrow. Контролируемая среда, верхний правый угол, L4. Вторая — городское робот-такси: тут внимание — верхний левый, зона предупреждения. Открытая городская среда, попытка высокой автономии при низкой применимости. Waymo держится только за счёт жёстко суженного домена; Cruise попытался расшириться — и провалился. Третья — чёрный лебедь: Суэц, пандемия, кризис. Это нижний левый, у начала координат: фактический L0 — задача для людей, не для AI. Заметьте: робот-такси и чёрный лебедь оба слева, но по разным причинам — одно провалилось от амбиций, другое осознанно отдано человеку.
[пауза]
И вот что отсюда следует. Одна и та же отрасль держит сразу три квадранта. Внутри одной компании — Amazon, FedEx — AI на складе работает почти автономно, а при сбое цепи всё держится на человеке-диспетчере. Зрелость локальна по задачам, а не глобальна по компании. Это противоречит интуиции «компания либо AI-зрелая, либо нет».
[быстрее]
Ещё три показательные точки. Наука — закрытый мир высоко, открытый низко: AlphaFold против Galactica, тот же класс моделей, но разная привязка к физике решает всё. Кибербезопасность — высокая применимость на наблюдении, но низкая на действии: радиус разрушения держит её внизу справа. А нефтегаз даёт урок переноса: «каменный» чат-бот на LLM геолога не заменит — пористость и проницаемость породы LLM просто не знает.
После полного показа на карте — около двадцати точек.
Кластер закрытой петли (верхний правый)¶
Теперь — кластерный анализ. Три ключевых кластера. Начнём мы с вами с самого плотного — верхний правый, закрытая петля.
Кто здесь? Инженер-агент в разработке ПО. Фрод-детекшен — Stripe Radar. See & Spray в агро. Складская робототехника — Symbotic. Свёртка белка — AlphaFold.
[пауза]
Запомните пять общих признаков этого кластера — это профиль успешного применения AI. Раз — среда контролируемая или закрытая. Два — эталон быстрый и однозначный: компилятор, чарджбэк, визуальная разметка, лабораторный анализ. Три — объём задач большой. Четыре — цена ошибки низкая или поглощаемая. Пять — обучающие данные совпадают с эксплуатацией.
Вот это — рабочие случаи. Тут AI окупается, тут он зрелый, тут он не маркетинг.
И вот зачем нам эти пять признаков. Когда вам встретится новая отрасль, не из курса, и задачи в ней удовлетворяют всем пяти — у проекта хорошие шансы. Это и есть перенос опыта: не помнить компании наизусть, а узнавать профиль.
Кластер открытой среды (верхний левый, зона предупреждения)¶
Второй кластер — верхний левый. Зона предупреждения. Кластер провалов: низкая применимость при попытке высокой автономии.
Кто здесь? Monarch — трактор в открытом поле. Plenty — вертикальные фермы, привлёкшие больше девятисот сорока миллионов долларов и рухнувшие до банкротства в марте двадцать пятого. Городское робот-такси Cruise. Чёрный лебедь Суэца. iBuying Zillow. Galactica с открытой генерацией гипотез.
[пауза]
Что общего? Среда открытая, есть сопротивление — погода, конкуренция, политика, биология. Данные не покрывают редкие события. Цена ошибки высокая — жизнь пешехода, банкротство компании, дезинформация в науке. Эталон медленный или отсутствует.
[медленно, с нажимом]
И вот главная мысль, нам важно её усвоить. Открытая среда — это не недостаток технологии. Это физика задачи. Никакая модель две тысячи двадцать шестого года этот разрыв не закроет. И ожидаемая модель двадцать восьмого тоже не закроет. Потому что проблема не в модели, а в распределении данных.
Что делать, если ваша задача попала сюда? Три варианта. Сузить домен — путь Cruise к Waymo. Перейти на советующий L1 с человеком в петле. Или отказаться от AI и взять классику.
Кластер высоких ставок (нижний правый, потолок регулятора)¶
Третий кластер — нижний правый. Высокие ставки. Высокая применимость, но автономия прикручена регулятором.
Кто здесь? Медицина — клинические решения на L1 по мандату FDA. Авиакосмос — действие ограничено регулированием. Безопасные системы в производстве — по нормативам. Действие в кибербезопасности — дисциплиной радиуса разрушения. Зоны взрывоопасности в нефтегазе — сертификацией оборудования.
[пауза]
Что общего? Применимость может быть высокой, но регулятор её ограничивает. Цена ошибки высокая. Объяснимость обязательна. Аудит обязателен.
И вот ключевой урок. В этих доменах автономия — не цель. Цель — усиление, не замена. Радиолог с AI-помощником лучше радиолога без — но решает всегда радиолог. Пилот с AI-осведомлённостью лучше пилота без — но спуск курка всегда за пилотом.
[прямо в зал]
И это не значит, что AI хуже. Это значит, что AI работает в роли советника — и эта роль зрелая, измеримая, окупающаяся. Aidoc обрабатывает миллионы снимков в год в режиме «человек в петле» — это успех, а не провал. Кстати, и денег усиление часто приносит больше, чем полная автоматизация, — потому что полную автоматизацию в высоких ставках почти никогда не достигают, а попытки проваливаются. Помните IBM Watson Health? Продан за миллиард, не выполнив ни одной заявленной цели.
Пустые квадранты как дидактика¶
Посмотрим на два внедиагональных квадранта. Их асимметрия — ключ к чтению всей карты.
[обвести верхний левый]
Верхний левый — пустой и опасный. Низкая применимость и при этом высокая автономия. Кто пытался сюда попасть? CrowdStrike — действие на L4 для системы средней применимости, гигантский радиус. F-35 ALIS — предиктивное обслуживание с высокой автономией на критичной к жизни системе. Cruise — высокая автономия в открытой среде, где применимость не подтверждена.
Урок этого квадранта: если применимость не высокая — не тянитесь к высокой автономии. Это асимметрия. Низкая применимость, помноженная на высокую автономию, — это катастрофа.
[обвести нижний правый]
Нижний правый — наоборот, заполнен. Высокая применимость, низкая автономия. Aidoc, Project Maven, скоринг под EU AI Act. Это не пустота, а потолок — заданный регулятором, не технологией.
[пауза]
И вот практика для вас. Диагностируйте свой проект: попадаю ли я в верхний левый? Если да — что изменить, чтобы сдвинуться? Два пути. Сдвинуться вправо — поднять применимость: закрыть среду, набрать данных, улучшить эталон. Это инвестиция в постановку задачи. Или сдвинуться вниз — снизить автономию, добавить человека в петлю. Это инвестиция в дизайн системы. Оба пути правильные. Невалиден только один маршрут — остаться в верхнем левом, наращивая автономию без роста применимости.
Раздел 4 (вступление раздела)¶
А теперь — ядро лекции о границах.
Двенадцать провалов курса. Для каждого — что выучили и какая альтернатива.
Это не злорадство над чужими ошибками. Это прививка: узнаёте паттерн в проекте — задаёте вопрос — и часто этого хватает, чтобы его остановить.
Провалы 1-4¶
Давайте мы с вами систематизируем провалы курса в двенадцать канонических классов. Первые четыре.
Провал первый — открытый мир без закрытой петли. Zillow, Monarch, Cruise. Все три применяли AI в открытой среде. Распределение сдвинулось — модель умерла. Урок: сдвиг данных не лечится добавлением данных, он лечится изменением постановки. Альтернатива — сузить домен или уйти в советующий режим.
Провал второй — накопление ненадёжности. Помните петлю на четыре тысячи двести долларов? Агент без ограничения бюджета закольцевался за ночь. Тут чистая математика: если каждый шаг успешен с вероятностью девяносто пять процентов, то на десяти шагах сквозной успех — пятьдесят девять процентов. На двадцати — тридцать шесть. Урок: это архитектурное ограничение многошаговых агентов. Альтернатива — лимит бюджета, ограничение шагов, человек-контролёр через каждые несколько шагов.
[пауза]
Провал третий — демо не равно продакшен. Devin, IBM Watson, Epic Sepsis, Klarna. Вендор показывает демо — продакшен показывает другое. Epic обещал точность ноль семьдесят шесть, в эксплуатации — ноль шестьдесят три. Урок: бенчмарк вендора измерен на его данных, в его среде. Альтернатива — перепроверьте на своих данных до коммита. Откажется дать — это сильный сигнал.
Провал четвёртый — скучный человек в петле. Uber в Темпе, F-35 ALIS. Человек, поставленный следить за редкими событиями, психологически не способен делать это часами. Альтернатива — человек на петле с пробуждением по тревоге, а не в петле на каждом шаге.
Провалы 5-8¶
Следующая четвёрка.
Провал пятый — переавтоматизация. Помните Tesla на разгоне производства в восемнадцатом? Маск признал: чрезмерная автоматизация замедляет конвейер. Твит «людей недооценивают» — апрель восемнадцатого. Это парадокс автоматизации, описанный ещё Бэйнбридж в восемьдесят третьем: автоматизация хороша в зонах низкой вариативности и ломается в зонах высокой. Альтернатива — принцип Toyota дзидока: усиление, не замена.
Провал шестой — действие без канарейки и отката. CrowdStrike, Cloudflare. Широкий домен означает большой радиус. Урок: действие с большим радиусом обязано иметь канареечный выпуск на один-пять процентов, телеметрию с ранним предупреждением, откат в один клик и поэтапное раскатывание. У CrowdStrike не было ни одного из четырёх.
[пауза]
Провал седьмой — научная галлюцинация класса Galactica. Фейковые статьи, фейковые ссылки. Урок: в науке эталон — это эксперимент, а не текст. Альтернатива — привязка к проверенным источникам и человеческое рецензирование со списком проверки каждой ссылки.
[понизить голос]
Провал восьмой — мошенничество через голос и видео. Помните дипфейк в Гонконге, февраль двадцать четвёртого? Сотрудник инженерной компании Arup перевёл двадцать пять миллионов долларов после видеоконференции, где и финансовый директор, и коллеги были дипфейками. Это уже мультимодальная атака — видео плюс голос. Урок: для крупных переводов — обязательная проверка через независимый канал. Перезвонить по проверенному телефону, а не по тому же каналу, откуда пришёл запрос.
Провалы 9-12¶
Последняя четвёрка. И обратите внимание: первые восемь провалов были про действие — про то, как AI что-то делает не так. Эти четыре — про данные и деньги: про то, чем вы рискуете ещё до того, как AI начал действовать.
Провал девятый — утечка обучающих данных дословно. Getty против Stability, NYT против OpenAI. У больших моделей есть «хвост запоминания»: часть обучающих примеров хранится дословно в весах и извлекается правильным промптом. Это юридический риск и для вас как пользователя. Альтернатива — лицензированные наборы данных, аудит происхождения.
Провал десятый — привязка к вендору в регулируемых отраслях. Climate FieldView, F-35 ALIS, Watson Health. Вендор-облако получает ваши чувствительные данные — и выход стоит миллионы. Альтернатива — собственная инфраструктура, пункты о выгрузке данных в контракте, мультивендорная стратегия.
[пауза]
Провал одиннадцатый — слопсквоттинг. Это новый вектор, появившийся из-за AI. Модели при генерации кода придумывают имена несуществующих библиотек — правдоподобные. Атакующие регистрируют эти выдуманные имена и кладут туда вредонос. Запускаешь AI-код — импортируешь зловред. Альтернатива — проверка состава ПО, белый список импортов, проверка существования библиотеки до коммита.
[медленно]
Провал двенадцатый — болото пилотов. И тут важно различать числа: маркетинг их склеивает. MIT NANDA и Sloan: девяносто пять процентов GenAI-пилотов не доходят до продакшена. McKinsey: только пять с половиной процентов компаний — высокие исполнители с эффектом на прибыль. Это разные измерения: MIT мерит провал пилотов, McKinsey — концентрацию лидеров. В России — девять из десяти пилотов не доходят. Альтернатива — явные точки «идём дальше или закрываем», базовая линия до старта, лимит бюджета.
Синтез: три мега-паттерна¶
[медленно, это кульминация раздела]
Двенадцать провалов. А теперь — главное, и нам важно это унести. Почти все они сводятся к трём мега-паттернам. Если вы запомните только три вещи из этого раздела — пусть это будут они.
Мега-паттерн первый — AI применён за границей закрытой петли. Zillow, Monarch, Cruise, Galactica. Полная автоматизация там, где обратная связь медленная, эталон неоднозначный, среда открытая. Проверка одной фразой: «Какая среда — закрытая или открытая?» Открытая — стоп.
Мега-паттерн второй — человек в петле спроектирован плохо. Uber, F-35, CrowdStrike. Человек формально был, а фактически не работал: скучный мониторинг, нет канарейки, нет отката. Проверка: «Кто этот человек, чем он занят, сколько раз в час он смотрит? Не скучно ли ему?»
Мега-паттерн третий — экономическая база проигнорирована. Демо-провалы, болото пилотов, привязка к вендору. Не измерили классическую альтернативу до старта. Проверка: «Какая база? Сколько даёт классика? Окупит ли AI дельту?»
[пауза]
Вот эти три вопроса — тридцатисекундная процедура, и нам с вами она пригодится на любом AI-предложении. И знаете что? Большая часть катастроф из реестра могла быть предотвращена ещё на стадии планирования, если бы инженер задал эти три вопроса.
И главное — эти паттерны переносятся через отрасли. Когда вы попадёте в новую отрасль, не из курса, они проявятся и там. Узнаете — сэкономите компании миллионы.
Что вы заберёте: четыре карточки¶
И последнее — то, что вы унесёте с собой физически.
Шестнадцать лекций были интенсивным погружением. После экзамена детали забудутся — какая компания, какой год, какие проценты. Это нормально. Что не должно забыться — это инструменты диагностики.
И чтобы они не забылись, мы с вами упаковали их в четыре опорные карточки — компактные печатные документы, которые вы заберёте с собой.
[показать на экран / на распечатки]
Карточка номер один — матрица из семи критериев. Карточка номер два — лестница автономии. Карточка номер три — реестр двенадцати провалов, главная по практической ценности. И карточка номер четыре — карта шестнадцати отраслей, большой плакат на стену. Кстати, она уже висит у нас в аудитории.
Зачем карточки? Атул Гаванде в «Манифесте чек-листа» показал: в авиации и хирургии чек-листы резко снижают число ошибок. В стрессе — под давлением вендорской презентации — мы забываем проверить важное. Карточка — это внешняя память. Давайте пройдём по ним.
Карточка #1: матрица решения¶
Карточка номер один — матрица «Применять ли AI». Семь строк, четыре колонки.
Каждая строка — критерий, который мы уже разобрали. Среда. Данные. Повторяемость. Цена ошибки. Эталон. Объяснимость. Экономика против классики. В каждой строке — индикатор: галочка, если AI подходит; треугольник предупреждения, если нужен человек в петле; крестик, если не подходит. И пример из курса.
[пауза]
Правило применения простое. Проходите семь строк по порядку. Хотя бы один крестик — стоп, отказ от полного AI для этой задачи. Два и больше предупреждений — стоп, обоснуйте человека в петле плюс канарейку плюс откат. Все семь галочек — идём в пилот, но с явными точками «идём дальше или закрываем».
Это самый частый инструмент, который вы будете применять. На любую вендорскую презентацию, любую планёрку «давайте внедрим AI» — пройдите семь строк. За пять-десять минут вы получите более структурированную оценку, чем большинство менеджеров проектов.
И отличная техника для команды: вывести карточку на экран и пройти семь строк вместе. Вместо «кажется, сработает» — «по строке два у нас предупреждение, давайте обсудим данные». Это снижает конформизм и поднимает качество.
Карточка #2: лестница автономии¶
Карточка номер два — лестница автономии, от нуля до пяти. Шесть строк, пять колонок.
Уровень, название, что AI делает, кто решает, и критерии подъёма на следующую ступень. В подвале карточки — антипаттерны: превышение роли на L1, скучный человек на L2, расширение домена на L3, действие без канарейки на L4, этический блок на L5.
[пауза]
Правило применения. Для любого AI-применения определите две вещи: текущий уровень и максимально допустимый. Если они различаются — нужен план подъёма с явными критериями. Большинство зрелых применений двадцать шестого года — это L1-L2. L3-L4 — для особых доменов: Waymo, See & Spray, склады. L5 — практически нигде.
И помните: эта карточка — живой документ. Это снимок двадцать шестого года. Через пять лет критерии подъёма могут измениться — регуляторы, страховые рынки, стандартизация. Возьмите её с собой и пересматривайте каждые два-три года.
Карточка #3: реестр провалов¶
Карточка номер три — двенадцать провалов и противоядия. Главная карточка по практической ценности. Двенадцать строк, четыре колонки.
Имя провала, источник, урок одной фразой, альтернатива. Это та самая прививка, которую мы собирали весь четвёртый раздел.
[пауза]
Правило применения. Когда читаете вендорскую презентацию, участвуете в планёрке, рецензируете статью — пройдите двенадцать строк. Узнаёте паттерн — задаёте уточняющий вопрос. Часто этого достаточно, чтобы спасти проект.
Почему именно двенадцать? Психологи знают со времён Миллера: человек оперативно держит в голове семь плюс-минус два элемента. Двенадцать — за пределами рабочей памяти. Поэтому их держат на бумаге, не в голове. Сократить до пяти — потеряем паттерны. Расширить до пятидесяти — карточка рассеется. Двенадцать — компромисс.
И ещё одна привычка, которую я очень рекомендую. После каждого вашего AI-проекта пройдите двенадцать строк: каких провалов избежали и почему, в какие чуть не попали и что поняли. Это личный разбор полётов. Через несколько лет такой практики вы будете различать паттерны лучше большинства коллег.
Карточка #4: мастер-карта¶
Карточка номер четыре — карта шестнадцати отраслей. Большой плакат, формат A1. Тот, что висит на стене.
Точечная диаграмма: горизонталь — применимость, вертикаль — автономия. Цветовые зоны квадрантов. Зелёный — закрытая петля, рабочие случаи. Красный — зона предупреждения. Серый — классика выигрывает. Синий — высокая применимость с потолком регулятора.
[пауза]
Правило применения — буквальное. Повесьте плакат на стену. Когда обсуждаете новый проект, попросите коллег показать пальцем, в каком квадранте задача. Само это упражнение ставит проект в структурированную рамку.
И для новой отрасли, которой в курсе не было, плакат даёт аналогии. «Эта задача похожа на See & Spray по структуре закрытой петли». Или «эта похожа на расширение Cruise — домен недостаточно узкий». Перенос опыта через аналогию — главная функция плаката.
И помните: карта обновляется. Waymo может перейти из узкого домена в широкий. Точки сдвигаются. А вот оси — применимость и автономия — устойчивы.
Главный вывод + вопросы и ответы + прощание¶
[медленно, это финал курса]
Главный вывод всего курса. Одна фраза.
Знать ИИ — значит знать его границы.
[пауза 2 сек]
В начале курса это звучало как лозунг. Сейчас — это инженерная дисциплина, которую мы с вами выстроили. Семь критериев. Шесть ступеней автономии. Двенадцать паттернов провалов. Две оси карты.
Не-инженер тянется к инструменту, не понимая его границ. Инженер сначала проверяет границы, потом берёт инструмент. Простая последовательность — но в эпоху хайпа дефицитная.
[прямо в зал]
Вы выходите из курса с тремя вещами. Первое — знание шестнадцати отраслей: что работает, что провалилось, и почему. Второе — инструменты диагностики: карта, критерии, лестница, провалы, четыре карточки. И третье — профессиональная позиция: вы не «AI-инженер» в маркетинговом смысле и не «промпт-инженер». Вы — инженер, который знает, когда AI применять, а когда нет. Эти три вещи не устареют, когда модели двадцать шестого года устареют.
[пауза]
И есть якорь, который я хочу оставить вам отдельно. Восемь канонических кейсов курса — запомните их по именам: Zillow, Watson, CrowdStrike, Galactica, Klarna, Plenty, Cruise, Uber. Когда случится новый CrowdStrike — а он случится — вы вспомните и не повторите.
[пауза]
Это и есть суть курса. Спасибо вам за эти семнадцать лекций. Удачи в работе.
Вопросы — давайте.
[Заключительная пауза]
До новых встреч.




































