Лекция 15. AI в научных исследованиях¶
Лекция 15 · 39 слайдов
Hook: AlphaFold Нобель vs Galactica retraction¶
[медленно, серьёзно]
Девятое октября две тысячи двадцать четвёртого года. Стокгольм. Шведская королевская академия наук объявляет лауреатов Нобелевской премии по химии. Половина — Дэвиду Бейкеру за вычислительный дизайн белков. Вторая половина — пополам Демису Хассабису и Джону Джамперу. За AlphaFold.
[пауза]
Это впервые в истории. Впервые Нобель по фундаментальной науке вручён за работу, в формулировке которой стоит конкретный AI-продукт.
[пауза 2 сек]
Теперь сдвиньтесь почти на два года назад. Пятнадцатое ноября две тысячи двадцать второго года. Meta запускает Galactica — большую языковую модель, обученную на сорока восьми миллионах научных статей. Слоган — «помощь учёным». Через три дня, семнадцатого ноября, модель отозвана. За эти три дня — фабрикованные цитаты, инструкции по синтезу взрывчатых веществ как «безопасный научный текст», расистские выводы. Заголовок MIT Technology Review восемнадцатого ноября — «Why Meta's Galactica only survived three days online» — стал эталонным предостережением.
[пауза]
Две картинки. Слева — AlphaFold Нобель. Справа — Galactica retraction. Одна и та же базовая технология. Большая модель машинного обучения. Два диаметрально противоположных результата.
И главный вопрос сегодняшней лекции — именно отсюда. Как инженер должен научиться различать: где AI в науке делает прорыв нобелевского уровня, а где он создаёт фабрику статей.
Это и есть тема Лекции пятнадцать.
[Переход на s02]
Cover¶
Лекция пятнадцать. AI в научных исследованиях.
Это третий модуль курса — прикладные применения. После лекций тринадцать и четырнадцать про логистику и кибербезопасность — мы с вами входим в самую интеллектуально-сложную отрасль. Науку.
Наука — это деятельность, в которой ошибка стоит дорого, но не в момент написания. Цена ошибки оплачивается в момент проверки: рецензирование, репликация, накопление цитат. Сегодня мы научимся диагностировать, на какой ступени научного цикла AI работает, а на какой — создаёт риск.
Keystone: лестница научного цикла из шести ступеней¶
[медленнее]
Это keystone-слайд. Несущая ось всей лекции. Запомните картинку — мы с вами будем возвращаться к ней на каждом слайде.
Шесть ступеней. Hypothesis. Design. Experiment. Analyse. Write. Review. Гипотеза, планирование, эксперимент, анализ, написание, рецензирование.
[пауза]
Главное отличие от лестниц прошлых двух лекций — она циклична. В Лекциях тринадцать и четырнадцать лестницы были последовательными. А научный цикл — итеративный: рецензент возвращает статью на доработку, автор идёт обратно к анализу. Из анализа возникает новая гипотеза.
Это свойство самой науки. Эту цикличность держим в голове весь час.
Глоссарий: пятнадцать обязательных терминов¶
Общий словарь. Пятнадцать терминов. Без них следующий час не сложится.
Пять ключевых. Фундаментальная модель — большая модель общего назначения: AlphaFold, Aurora, GNoME. RAG — поиск с генерацией: NotebookLM, Elicit. Галлюцинация — правдоподобный, но фактически неверный вывод. Не сбой — нормальное поведение модели. Закрытый и открытый мир — закрытая задача имеет проверяемый ответ внутри системы; открытая требует выхода за её пределы. Человек в петле, HITL — явные точки человеческого решения в конвейере.
Остальные десять — IDP, эталонная разметка, CASP, DFT, BO, ECMWF, FrontierMath, ICMJE, IMO, фабрика статей — встретим в контексте.
Центральный вопрос¶
Центральный вопрос лекции — вот этот:
[медленно]
Где AI делает прорыв в науке, где он создаёт фабрику статей, и как инженер должен решать, в какой класс попадает его конкретный случай?
К концу лекции мы с вами выстроим пятишаговую рамку — классифицируй задачу, отобрази альтернативы, примени четыре критерия, спроектируй HITL, проверь до публикации. Эта рамка применима в инженерной практике немедленно. Запишите её на отдельном листе — мы будем к ней возвращаться.
Раздел 1: Hypothesis + Design¶
Мы с вами входим в первый раздел из пяти.
Hypothesis + Design — где AI продаётся за автономию, но даёт узкую помощь.
Это самая хайповая зона лекции. И самая хрупкая. Когда AI не может быть проверен немедленно, велик соблазн принять правдоподобное за истинное.
Разобранный пример WE-1: дерево решения «идея для гранта»¶
Допустим, ваш руководитель просит придумать идею для гранта. У вас три варианта.
Первый — попросить Sakana AI Scientist сгенерировать пятьдесят кандидатов гипотез. Второй — попросить руководителя предложить три из его опыта. Третий — самостоятельно прочитать тридцать обзорных статей и сделать собственную карту.
Какой выбираете?
[пауза]
Шестишаговое дерево решения.
Шаг первый — классифицируй задачу. Hypothesis — это открытый мир. Эталонной разметки нет, проверка — через эксперимент, занимающий годы. Это уже критически важно: открытый мир означает, что Sakana не имеет верифицируемого ответа.
Шаг второй — покрытие. Sakana обучен на опубликованных текстах. То, что не публиковалось — закрытые тупики, известные старшим коллегам, неудачные эксперименты конкурентов, — у Sakana отсутствует. Базовая контр-претензия: руководитель PhD знает эти тупики из десятилетия работы.
Шаг третий — проверяемость. Идею проверим только через годы экспериментов. На этом интервале — ноль обратной связи AI о качестве своих предложений.
Шаг четвёртый — этика. ICMJE запрещает AI как автора грантовой заявки. Раскрытие использования AI обязательно.
Шаг пятый — проектирование HITL. Sakana генерирует пятьдесят, руководитель отбирает пять по экспертизе, аспирант проверяет два через чтение литературы и пилотный эксперимент. Это конкретные шлюзы.
Шаг шестой — целостность подачи. Грантодатель ожидает оригинальной гипотезы, не рекомбинации литературы. В Methods раздела гранта — открытое раскрытие использования Sakana как мозгового штурма.
[пауза]
Вердикт. Sakana — отправная точка для мозгового штурма, не финальный фильтр. Руководитель плюс ваше чтение плюс Sakana как расширение для генерации вариантов. Это расширение, а не автономия.
Sakana AI Scientist: «1 из 3 прошла рецензирование»¶
Sakana AI — японско-сан-францисская компания, основанная в две тысячи двадцать третьем году. Их флагман — AI Scientist v2, апрель две тысячи двадцать пятого. Опубликовали системную работу на arxiv номер двадцать пять-ноль четыре-ноль восемь-ноль шесть-шесть (Yamada и соавторы). Заявление: «1 из 3 наших статей прошла рецензирование на воркшопе ICLR 2025».
[медленно]
Звучит впечатляюще. Но смотрите на циферблат внимательнее.
Sakana запускается в режиме сто статей за цикл. Из этих ста человек-куратор отбирает три лучшие для отправки. Из трёх отправленных одна получает приём.
[пауза]
Три разные доли, которые маркетинг сливает в один лозунг. Три процента — это отбор лучших: три из ста сгенерированных. Тридцать три процента — это приём среди отправленных. И только один процент — это истинная доля автономной науки: одна из ста сгенерированных, прошедшая всю цепочку.
Маркетинговая фраза «1 из 3» — это тридцать три процента. Истинная скорость — один процент. Помните эту разницу — она применима к любому AI-вендору, рекламирующему «успехи».
Coscientist vs DeepMind Co-Scientist¶
Здесь обязательное разграничение. Две системы с почти одинаковыми названиями, постоянно путаемые в популярной прессе.
Coscientist — без дефиса, одним словом. Это Карнеги-Меллон университет, статья в Nature декабрь две тысячи двадцать третьего, Boiko и соавторы. Это управляемая большой языковой моделью автономная лаборатория химии для синтеза. Архитектура — GPT-4 и Claude одновременно, в разных ролях агентов. Применение — синтез известных реакций палладий-катализируемого кросс-сочетания. Это автоматизация известных протоколов, не открытие новой химии.
Co-Scientist через дефис — это Google DeepMind, статья в Nature май две тысячи двадцать шестого. Архитектура — дебаты и ранжирование нескольких агентов. Применение — поиск терапевтических мишеней для фиброза печени, совместно со Стэнфордом.
[пауза]
Разные системы, разные фазы цикла, похожие названия. Запомните это разграничение — оно вам пригодится, когда коллега скажет «слышал про Co-Scientist».
Sakana отбор лучших — четыре структурные проблемы¶
Возвращаемся к Sakana. Что показал независимый аудит принятой статьи.
Первая проблема — механика отбора лучших. Сто статей сгенерировано, три отобраны человеком, одна принята. Это не автономная наука. Это AI-расширенные черновики с тяжёлым человеческим фильтром.
Вторая — галлюцинированные ссылки. Аудит показал, что часть цитированных работ либо не существует в указанной форме, либо результаты искажены. Это структурное свойство языковых моделей, генерирующих библиографии: модель знает, как выглядит научная ссылка, и генерирует правдоподобную последовательность токенов — но без онтологической связи с реальной публикацией.
Третья — фальсифицированные результаты. В принятой статье обнаружены численные значения, которые не соответствуют тому, что генерировал собственный код эксперимента Sakana. Это галлюцинация в фазе написания: агент-автор переписывает раздел Results и придумывает «правдоподобные» числа, не сверяясь со скриптом.
Четвёртая — преувеличенная новизна. «Новый метод» оказался реализацией техники, опубликованной в две тысячи двадцать втором году в другом контексте.
[пауза]
Главный урок. Прохождение рецензирования — не доказательство научной валидности. Рецензирование — фильтр, отсеивающий очевидно плохие работы, но не гарантирующий правильность принятых.
Альтернатива: байесовская оптимизация + гауссовский процесс¶
Что вместо Sakana работает.
Байесовская оптимизация (Bayesian Optimization, BO) — сорок плюс лет теории. Гауссовский процесс (Gaussian Process, GP) — шестьдесят плюс лет. Зрелая математически обоснованная альтернатива для планирования экспериментов в катализе, разработке лекарств.
В оптимизации катализаторов BO достигает семидесяти процентов доли успеха против тридцати у случайного скрининга. Ускорение кампании — в пять-десять раз.
Это не запасной вариант. Это зрелый рабочий инструмент, обгоняющий Sakana в реальных применениях. Надо знать всем, кто планирует исследование.
Раздел 2: Experiment — самый сильный успех¶
Переходим ко второму разделу из пяти.
Experiment — самый длинный раздел лекции и самый положительный по тону. Здесь мы с вами увидим прорывы нобелевского уровня. Но успех нобелевского уровня — не означает финальности нобелевского уровня. Каждый подраздел будет с трещиной.
AlphaFold timeline + Recursion-Roche каскадный эффект¶
История AlphaFold начинается в две тысячи шестнадцатом. Первая версия выиграла CASP13 в две тысячи восемнадцатом. Прорыв — CASP14, декабрь две тысячи двадцатого: средний GDT_TS девяносто два против семидесяти пяти у предыдущих лучших методов. На труднейших задачах Free Modeling — девяносто два против шестидесяти. Пятидесятитрёхпроцентное улучшение.
[пауза]
AlphaFold 3 — восьмого мая две тысячи двадцать четвёртого. Расширение пространства применения с одиночных белков до комплексов белок-лиганд — критически важно для разработки лекарств. Пятьдесят процентов точности роста против AutoDock Vina и GLIDE.
И девятого октября — Нобель.
Каскадный эффект Нобеля — конкретный, измеримый. Recursion Pharmaceuticals заключила сделку с Roche в декабре две тысячи двадцать первого — то есть до Нобеля, но в его эффекте. Сто пятьдесят миллионов долларов первоначального платежа. До сорока программ. Каждая программа — до трёхсот миллионов долларов контрольных выплат. Суммарный потенциал — до двенадцати миллиардов долларов при достижении всех контрольных вех.
[пауза]
Это масштаб того, что Нобель легитимизировал. Не премия, а сигнал, который дочерним системам — рынки, финансирование, фарма — даёт понимание относительной важности направления.
AlphaFold DB: 200M структур + дебат о закрытом коде¶
Архив структур. DeepMind и European Bioinformatics Institute запустили AlphaFold Protein Structure Database в июле две тысячи двадцать первого. К две тысячи двадцать шестому — более двухсот миллионов предсказанных структур.
Сравните. Protein Data Bank — основной репозиторий экспериментально решённых структур, основан в семьдесят первом. К две тысячи двадцать четвёртому — около двухсот тысяч. AlphaFold DB содержит в тысячу раз больше предсказанных структур, чем PDB содержит экспериментально решённых за полвека работы кристаллографов всего мира.
[пауза]
Но AlphaFold 3 при запуске мая две тысячи двадцать четвёртого был закрыт. Только веб-интерфейс, лимиты по запросам, нет коммерческого использования. Тысяча учёных подписали открытое письмо с требованием открыть веса. Ноябрь — академическая лицензия. Февраль две тысячи двадцать пятого — публичная доступность для некоммерческого использования.
[медленно]
Это бизнес-стратегия, а не философский вопрос. Isomorphic Labs — стартап-выходец DeepMind — заключила сделки на миллиарды с Eli Lilly и Novartis в начале две тысячи двадцать четвёртого. AlphaFold 3 — конкурентный актив в этих сделках. Открытие весов значило снижение оценки.
Boltz-1: открытая альтернатива обгоняет¶
Декабрь две тысячи двадцать четвёртого. Команда MIT — Corso, Wohlwend и соавторы — публикует Boltz-1 на biorxiv 2024.11.19.624167. Полностью открытый исходный код конкурента AlphaFold 3. Лицензия MIT, разрешает коммерческое использование, полный код и веса.
К концу две тысячи двадцать пятого Boltz стал самой широко используемой открытой моделью своего класса. Обогнал AlphaFold 3 по академическому внедрению.
[пауза]
Это закономерность. Stable Diffusion 1.5 обогнал DALL-E 2 через шесть месяцев. LLaMA 2 обогнал шаблоны развёртывания только-GPT-4 для академических исследований. Mistral 7B стал основой для нескольких дообученных моделей.
Применимый урок. Когда вы выбираете AI-инструмент для академической работы — по умолчанию выбирайте открытый исходный код, если есть достаточно близкая открытая альтернатива. Это устраняет привязку к вендору и обеспечивает долгосрочную воспроизводимость вашей работы через три-пять лет.
GNoME + A-Lab Berkeley: 41 из 58 за 17 дней¶
Ноябрь две тысячи двадцать третьего. DeepMind публикует в Nature результаты GNoME — Graph Networks for Materials Exploration. Фундаментальная модель для предсказания стабильных кристаллических структур.
Числа. Два миллиона двести тысяч кандидатов сгенерировано. Триста восемьдесят тысяч прошли валидацию стабильности через DFT — теорию функционала плотности. Шесть раундов активного обучения — на каждом раунде расширяются и тренировочный набор, и пространство кандидатов.
Триста восемьдесят тысяч — это в сорок четыре раза больше, чем содержалось в Materials Project на момент публикации.
[пауза]
Параллельно — A-Lab Berkeley. Автономная химическая лаборатория Lawrence Berkeley National Laboratory под руководством Gerbrand Ceder. Роботизированная платформа синтеза плюс предсказания GNoME. И главная цифра, каноническая:
A-Lab Berkeley синтезировала 41 из 58 целевых соединений за 17 дней непрерывной работы.
Семьдесят процентов доли успеха. Базовая линия ручной химии — одна цель требует от недель до месяцев работы аспиранта без гарантии успеха. A-Lab быстрее в сорок-шестьдесят раз по производительности синтеза.
Это впечатляющий результат. Но мы тут же должны переходить к следующему слайду.
Палгрейв-Шуп критика: 35 из 36 имели ошибки¶
Январь две тысячи двадцать четвёртого. Роберт Палгрейв из University College London и Лесли Шуп из Принстонского университета публикуют на ChemRxiv критику — препринт с DOI десять точка два-шесть-четыре-три-четыре. Они проанализировали тридцать шесть «успешных» образцов A-Lab — те тридцать шесть из сорока одного синтезированного, для которых были доступны достаточные данные.
И результат:
[медленно]
Из 36 проанализированных «успешных» проб A-Lab — 35 содержали как минимум одну из трёх ошибок.
Тип первый — двенадцать из тридцати пяти. Неверное присвоение фазы. GNoME предсказала, например, тернарное соединение AlMnO3. A-Lab показал XRD-пики, автоматическая система интерпретировала как целевое. Но при ручном анализе реальный продукт — смесь Al2O3 + Mn2O3, не AlMnO3.
Тип второй — пятнадцать из тридцати пяти. Производное или твёрдый раствор. Целевое — BaSn2O6. Реальное — Ba0.97Sn2.03O6 с лёгким отклонением стехиометрии или BaSnO3 + SnO2 — декомпозиция в известные фазы. Это не новые соединения.
Тип третий — восемь из тридцати пяти. Отсутствие функциональной валидации. Соединение существует. XRD подтверждает. Но что оно делает — никаких измерений нет. Это бессодержательно для применений.
[пауза]
Только одна из тридцати шести прошла независимую проверку без замечаний. Реальная доля подтверждённых открытий — ближе к одной-двум из пятидесяти восьми, не сорока одной.
Предсказание не равно открытию. Запомните эту фразу.
Aurora 5000× и оперативный статус ECMWF AIFS¶
Aurora. Microsoft Research, июнь две тысячи двадцать четвёртого, Nature. Фундаментальная модель для атмосферы с миллиардом тремястами миллионами параметров. Обучена на корпусе данных реанализа ERA5. Заявленный главный результат — в 5000 раз быстрее, чем эталон ECMWF IFS.
[пауза]
Пять тысяч раз. То, что ECMWF делает за час на суперкомпьютере, Aurora делает за меньше секунды на одной видеокарте.
Это валидное эталонное утверждение для конкретного применения. Но невалидное утверждение политики.
Aurora не используется оперативно ни в одной национальной метеослужбе. Похожая ситуация с GraphCast, Pangu-Weather, FourCastNet. Все эти фундаментальные модели — эталонные тесты, не развёрнутые в производстве.
ECMWF AIFS — другая история. Это собственная разработка ECMWF, оперативная с двадцать пятого февраля две тысячи двадцать пятого. Открытые веса, доступна через ECMWF API. Не Aurora, не GraphCast — внутренняя интеграция AI вместе с классическим IFS.
[пауза]
И трещина. Все ML-модели погоды систематически уступают на экстремальных событиях — пиковая интенсивность ураганов, локальные осадки, атмосферный блокинг. Это связано с фундаментальным свойством обучения на гистограмме: экстремальные события сглаживаются. Это не дефект Aurora — это структурное свойство ML-подхода в погоде.
AlphaProof IMO 2024: серебро + неразрешённая комбинаторика¶
Июль две тысячи двадцать четвёртого. DeepMind объявляет: AlphaProof плюс AlphaGeometry 2 решила четыре из шести задач Международной математической олимпиады. Двадцать восемь баллов из сорока двух. Серебряная медаль. Nature 2025, DOI 10.1038/s41586-025-09833-y.
AlphaProof решила P1 — алгебра, P2 — теория чисел, P6 — алгебра. AlphaGeometry 2 — P4, геометрия. А P3 и P5 — комбинаторные — остались нерешёнными.
[пауза]
Это иллюстративно. Формальное доказательство в комбинаторике остаётся открытой границей. Алгебра и теория чисел имеют богатую структуру лемм в Lean — proof assistant. Комбинаторика требует специфических индуктивных конструкций или явных биекций.
И трещина. Каждая задача потребовала часов GPU-времени. Человек-олимпиадник имеет девяносто минут. AI решил правильно, но медленно.
FrontierMath от Epoch AI. Запуск ноябрь две тысячи двадцать четвёртого — менее двух процентов у GPT-4o, Claude 3.5, o1-preview. К маю двадцать шестого — пятьдесят два с половиной процента у GPT-5.5 Pro. Свежесть на день: Epoch AI в мае двадцать шестого объявили — проверка обнаружила у трети задач возможные ошибки; пересмотренные оценки ожидаются. Но и сейчас сорок восемь процентов задач остаются нерешёнными.
Раздел 3: Analyse — надёжные применения¶
Третий раздел из пяти.
Analyse — фаза анализа данных. Самая готовая к промышленному применению ступень научного цикла для AI в две тысячи двадцать шестом. Здесь, как мы с вами увидим, меньше скандалов и больше повседневной полезности.
Почему. Здесь есть эталонная разметка.
TESS+Kepler CNN: 1 595 кандидатов, 83,9% точности¶
Поиск экзопланет. TESS — Transiting Exoplanet Survey Satellite — запущен в две тысячи восемнадцатом, последователь Kepler. TESS непрерывно наблюдает яркость десятков тысяч звёзд каждые две минуты. Когда планета транзитирует диск звезды, яркость кратковременно падает на доли процента.
Классический конвейер до AI — Box Least Squares, BLS, Kovács и соавторы две тысячи второго, A&A 391. Статистический метод поиска периодических провалов. Работал, но требовал ручного просмотра.
С две тысячи восемнадцатого — CNN. Shallue и Vanderburg, Google плюс UT Austin. Обучили на размеченных положительных и отрицательных. AUC 89 процентов против 78 у BLS.
[пауза]
К две тысячи двадцать шестому — производственные конвейеры. Конкретная работа — Huang и Jiang, arxiv 2512.00967. Модель идентифицировала тысячу пятьсот девяносто пять высокоуверенных планет, точность 83,9 процента на отложенной валидации.
Структурно. AI работает потому, что есть ясная эталонная разметка — подтверждённые планеты против известных ложных срабатываний. Транзитный паттерн имеет чёткую морфологию. И финальное подтверждение каждого кандидата требует последующих наблюдений, которые делают астрономы-люди. Расширение, не автономия.
Allen MICrONS: 1 мм³ зрительной коры¶
Allen Institute MICrONS — Machine Intelligence from Cortical Networks. Опубликовано в апреле две тысячи двадцать пятого. Главная статья — Nature 640 (MICrONS Consortium, DOI 10.1038/s41586-025-08790-w), и сопутствующие в Nature и Science.
Реконструкция одного кубического миллиметра зрительной коры мыши. Конкретные числа: более двухсот тысяч анатомически реконструированных нейронов. Около пятисот миллионов синапсов. Четыре километра аксонов.
Процедура. Ткань мозга фиксируется и разрезается на ультратонкие сечения тридцать нанометров. Каждое сечение визуализируется на электронном микроскопе. AI-сегментация идентифицирует каждый нейрон в каждом сечении. AI-трассировка связывает сегменты через сечения в трёхмерные нейроны. Без специализированного глубокого обучения — архитектуры U-Net для сегментации, методы на основе трансформеров для трассировки — этот коннектом был бы буквально невозможен. Ручная трассировка более двухсот тысяч нейронов потребовала бы тысячи человеко-лет.
[пауза]
Это канонический случай применения AI в биологии. Задача, которая раньше была невозможна, становится возможной благодаря AI.
И граница. Один кубический миллиметр — очень малая часть мозга. Полный мозг мыши — пятьсот таких. Человеческий — миллион. Экстраполяция от одного миллиметра к организменному уровню — открытая проблема. И полная реконструкция мозга мыши — минимум десятилетие в будущем.
LIGO ML-конвейер + конформное предсказание¶
LIGO — Laser Interferometer Gravitational-Wave Observatory. Массив детекторов гравитационных волн, запущен в две тысячи пятнадцатом. К двадцать шестому году обнаружено около ста пятидесяти подтверждённых событий.
Классический конвейер — сопоставление с шаблонами. Метод Винера тысяча девятьсот сорок девятого года. Восемьдесят плюс лет в обработке сигналов.
Где AI помогает. ML-методы — CNN на сырых временных рядах деформации — добавляются для быстрого первичного просмотра в реальном времени. Не заменяют сопоставление с шаблонами — добавляют. Конкретная статья — Ashton, Malz, Colombo, arxiv 2504.17587 две тысячи двадцать пятого года.
[пауза]
И важный методологический термин — конформное предсказание. Это статистический метод для количественного определения неопределённости. Для каждого предсказанного события конформное предсказание даёт калиброванный доверительный интервал: «этот сигнал реален с девяносто пятью процентами уверенности».
Отличие от классических доверительных интервалов — не зависит от распределения. Не предполагает, что остатки нормально распределены. Это важная методологическая инновация — любое предсказание AI должно сопровождаться количественным определением неопределённости для ответственного научного использования.
ML — расширение сопоставления с шаблонами, не замена. Финальная атрибуция остаётся за физикой.
AlphaFold IDP: 22% галлюцинаций, α-синуклеин¶
Мы с вами возвращаемся к AlphaFold — теперь к его провалу. Глубокий разбор.
IDP — intrinsically disordered protein. Внутренне разупорядоченный белок. Белки или регионы без стабильной трёхмерной структуры. Около тридцати-сорока процентов протеома человека содержит IDP-регионы. Они критически важны в сигнализации, регуляции, фазовых переходах.
Почему AlphaFold не работает на IDP. Модель обучена на структурах PDB. PDB содержит только стабильные структурированные белки. IDP невозможно кристаллизовать, их сигнатуры показывают конформационный ансамбль. Поэтому IDP недопредставлены в тренировочном распределении AlphaFold.
[пауза]
Конкретный показатель. Около двадцати двух процентов остатков в IDP-регионах систематически галлюцинированы. Это систематически неправильная структура, не «низкая точность». Источник — Akdel и соавторы, Nature Structural and Molecular Biology 2022; продолжение анализа — Gopalan и Narayanan, arxiv 2510.15939.
И конкретный пример. α-Синуклеин — белок, ассоциированный с болезнью Паркинсона. Большой регион IDP. Физиологически существует в конформационном ансамбле. Предсказание AlphaFold показывает специфическую α-спиральную связку, которая не соответствует физиологической конформации.
Если разработчик лекарства использует это предсказание для проектирования лекарства против агрегации α-синуклеина — он работает против неправильной мишени.
[пауза]
Что делать. Проверяйте pLDDT для каждого остатка вашей мишени. Для регионов с pLDDT меньше семидесяти относитесь как к высокой неопределённости. Перекрёстно проверяйте с данными ЯМР. Для регионов IDP используйте специализированные инструменты моделирования ансамблей.
Не публикуйте результаты докинга лекарств, основанные на AlphaFold для регионов IDP, без оговорки. Это конкретное обязательство.
Разобранный пример WE-TESS: пятишаговая рамка¶
Применим методологию к конкретному случаю. Вам дали тысячу часов данных TESS — кривые блеска для пятидесяти тысяч звёзд. Какой подход использовать?
Четыре варианта. A — предобученный CNN NASA Kepler, дообученный для TESS. B — обучить свой CNN. C — классический BLS плюс ручной просмотр. D — гибрид BLS первичный плюс CNN вторичный.
Пятишаговая рамка.
Шаг первый — анализ перекрытия данных. TESS против Kepler. Разные камеры, разный такт, разная модель шума. Сдвиг распределения существенный. Предобученный CNN Kepler будет уступать без дообучения.
Шаг второй — проверка доступности разметки. Каталог TOI — около шести тысяч записей. Размер скромный против тридцати тысяч кандидатов Kepler.
Шаг третий — оценка стоимости GPU. Обучение своего CNN — недели на восьми видеокартах, десять тысяч долларов. Дообучение предобученного — часы на одной, сто-пятьсот долларов. Классический BLS — минуты на процессоре, ноль долларов.
Шаг четвёртый — эталон доли ложноположительных. BLS — AUC семьдесят восемь процентов. Предобученный CNN Kepler на TESS с дообучением — восемьдесят девять. Свой CNN TESS — девяносто два. Выигрыш своего над дообученным — три процента AUC.
Шаг пятый — проверка на отложенных ста часах. Запустите все четыре, вручную проверьте кандидатов.
[пауза]
Решение для типичного аспиранта без сверхресурсов. Этап первый — вариант А, предобученный плюс дообучение. Этап второй для производства — гибрид D, BLS плюс CNN. Свой CNN оправдан только при большой размеченной выборке и бюджете на недели GPU. Классический BLS — эталон сравнения, с которым вы всегда сравниваете.
Эта пятишаговая рамка применима к любому ML-решению в фазе анализа. Не «рамка для экзопланет» — рамка для ответственного развёртывания AI в любой научной задаче.
Раздел 4: Write + Review — против академической добросовестности¶
Переходим к четвёртому разделу из пяти.
Write плюс Review — самая концентрированная зона провалов лекции. Здесь AI не помогает аккуратно. Здесь AI активно создаёт риск для научного метода — и нам с вами это важно понимать.
Если у вас остаётся только одно воспоминание из лекции — должно быть отсюда.
NotebookLM (17M) + Elicit (138M статей, 4× ускорение)¶
Зрелые инструменты обзора литературы. Используются массово.
NotebookLM — Google, запущен в две тысячи двадцать третьем. RAG-инструмент для персонального корпуса. Загружаете пятьдесят PDF, задаёте вопросы, получаете ответы со ссылками на конкретные предложения. К концу две тысячи двадцать пятого — 17 миллионов с лишним активных пользователей в месяц.
Elicit — Ought.io, две тысячи двадцать первый и далее. RAG-инструмент специально для обзора литературы. База — 138 миллионов академических статей. Сокращает время обзора литературы в 4 раза по валидированному пользовательскому исследованию.
[пауза]
Это работающее расширение. Зрелое, массовое. Но:
Психологический риск — склонность доверять автомату. Когда вы получаете «авторитетный» ответ из NotebookLM, есть смещение к принятию без проверки. NotebookLM иногда придумывает «цитаты» внутри корпуса, которые при проверке не привязаны к реальному содержимому. Качество синтеза ограничено качеством исходных документов. И главное — студент, полагающийся на NotebookLM, не читает статьи глубоко.
Правильный режим использования — отправная точка, не финальный синтез. Каждое важное утверждение проверяйте ручным чтением. Это превращает четыре часа ручного чтения в неделю в один час NotebookLM плюс один час целевой проверки. Чистая экономия два часа на статью при сохранении глубины.
WE-2: 4-шаговая проверка библиографии от соавтора¶
Это самый важный разобранный пример лекции. Завтра вы попадёте в эту ситуацию.
[медленно]
Контекст. Ваш соавтор присылает черновик статьи с сгенерированной языковой моделью библиографией из 47 цитат. Предлагается позиция соавтора. Что делать?
[пауза]
Сначала признаём эмоциональный момент. Это неудобная ситуация. Соавтор — обычно старший или равный. Сомнения в его работе — социально неловки. Но: ваше имя на статье — это ваша научная репутация. Если статья будет отозвана из-за фейковых цитат, ваше имя пойдёт вместе.
Это не время для социальной вежливости. Это время для профессиональной строгости.
Четырёхшаговый процесс.
Шаг первый — разрешение DOI каждой цитаты. Откройте Zotero автоматическое разрешение. Десять минут на сорок семь цитат. Критерий провала — три и более фейковых. Цитаты не разрешаются или разрешаются к другим статьям. СТОП. Откажитесь от соавторства.
Шаг второй — проверка релевантности. Выборка десять случайных. Прочитайте абстракт и релевантный раздел. Цитата поддерживает утверждение? Тридцать минут. Критерий провала — три из десяти нерелевантны или противоречат. СТОП.
Шаг третий — GPTZero на стилистике. Прогоните библиографию плюс введение плюс заключение. Пять минут. Если семьдесят процентов «вероятно сгенерировано AI» — сигнал. Перекрёстно проверьте через Originality.ai и Crossplag.
Шаг четвёртый — запрос исходных файлов. Попросите соавтора прислать PDF цитированных статей. Если откажется или присылает с задержкой больше двух дней — диагностический сигнал.
[пауза]
Сорок пять минут вашего времени. Против четырёх часов ручной проверки сорока семи цитат. Против постоянного ущерба карьере при отзыве. Соотношение издержек и выгод ясное.
Frontiers «крыса»: 13-16 февраля 2024, Midjourney¶
Тринадцатого февраля две тысячи двадцать четвёртого года журнал Frontiers in Cell and Developmental Biology опубликовал статью с нарисованной Midjourney анатомией крысы.
[медленно]
На фигуре. «Protemns» вместо «proteins». «Zxpens» вместо «sperm». Несуществующие термины. Анатомически невозможные органы. Гипертрофированные репродуктивные структуры.
Отозвана через три дня — шестнадцатого февраля.
[пауза]
И вот что важно. Статья раскрыла использование AI. Авторы написали в Methods: «Figures generated using Midjourney». То есть раскрытие AI не спасло — рецензенты пропустили очевидно нелепую анатомию.
Главный урок. Раскрытие — необходимо, но недостаточно. Рецензирование должно проверять фигуры отдельно, систематически, с экспертом-анатомом, когда статья содержит анатомические иллюстрации. Если AI-сгенерированная фигура выглядит правдоподобной для непрофильного рецензента, никакое раскрытие не спасёт.
Это конкретный антипаттерн. Если соавтор предлагает AI-сгенерированную фигуру — вы лично проверяете её на нелепости. Анатомически? Физически? Биологически? Если у вас нет экспертизы для проверки — попросите коллегу-эксперта или откажитесь от использования фигуры.
NeurIPS 2025: 100+ фейковых цитат в 53 статьях¶
Двадцать пять-двадцать шесть. NeurIPS — главная конференция по машинному обучению. Цифры приёма две тысячи двадцать пятого:
[медленно]
Двадцать одна тысяча пятьсот семьдесят пять поданных. Пять тысяч двести девяносто принятых. Доля приёма — 24,52 процента.
Запомните это число. Двадцать четыре с половиной процента. Это прорецензированная доля приёма топовой конференции.
И отдельный отчёт двадцать шестого года, GPTZero Research, arxiv 2602.05930. Более ста фейковых цитат проникли в пятьдесят три принятые статьи.
[пауза]
Структурно. Каждая статья имеет сто-двести цитат. Пятьдесят три статьи из пяти тысяч двухсот девяноста — это один процент принятых. Но сто фейковых цитат — это сто записей в научной литературе, которые не существуют, но которые могут цитироваться будущими работами.
Каскадный эффект. Сегодняшняя фейковая цитата → завтрашняя статья её цитирует → её цитирует следующая работа. Спустя три-пять лет загрязнённая сеть цитирования становится неотличимой от реальной для непрофильного читателя.
Это и есть фабрика статей — paper mill — в действии. Но фабрикуется не сама статья — фабрикуется сеть цитирования, делающая статью более авторитетной, чем она есть.
И главное. Рецензирование не справилось. Двести рецензентов, тысячи метарецензентов, сложные процессы NeurIPS — пропустили. Это структурный режим провала, не индивидуальная ошибка.
Каждая сгенерированная языковой моделью цитата требует проверки. Каждая. Без исключений.
ICMJE + публикационные политики 2024¶
Сводное правило академической добросовестности.
ICMJE — International Committee of Medical Journal Editors. Рекомендации обновлены две тысячи двадцать третьего и двадцать четвёртого. Явно затрагивают использование AI.
[медленно]
Правило первое. AI не может быть указан как автор. Авторство требует ответственности за работу. AI не может нести юридическую и этическую ответственность.
Правило второе. Помощь AI должна быть раскрыта в разделе Methods или Acknowledgements. Конкретно — какие инструменты, для каких задач.
Правило третье. Авторы остаются полностью ответственны за контент. «Я этого не писал, ChatGPT написал» — невалидная защита.
Правило четвёртое, добавлено в двадцать четвёртом. Использование AI в рецензировании должно быть раскрыто редакторам. Большинство журналов — Frontiers, Springer, Elsevier — полностью запрещают AI в рецензировании без явного предварительного одобрения.
[пауза]
Параллельные политики. Springer Nature август две тысячи двадцать четвёртого. Elsevier июнь. Frontiers март. Nature январь. ACS две тысячи двадцать четвёртого. Все обновили на явные требования раскрытия AI.
Пять этических критериев. Раскрытие. Проверяемость. Целостность авторства. Принятая ответственность. Воспроизводимость. Каждый — защитная функция против конкретного режима провала.
Каскадный риск. Если статья отозвана из-за нераскрытого AI или фейковых цитат — это постоянный ущерб карьере. Отзыв остаётся в резюме навсегда. Стоимость одного отзыва часто превышает совокупную выгоду от ста успешных AI-помощных статей. Это арифметика, не риторика.
Раздел 5: Когда AI не нужен — критерии + альтернативы¶
Пятый раздел из пяти.
Результирующий раздел. После четырёх разделов разбора, где AI работает и где нет, мы с вами синтезируем применимую ментальную модель. Это то, что вы уносите из лекции в свою профессиональную жизнь.
Четыре категории критериев «AI не нужен / вреден»¶
Четыре категории. Любое срабатывание — сигнал, что AI может быть неуместен.
Категория A — открытый мир без проверяемой эталонной разметки. Биология организменного уровня, психология, история, сравнительная литература. AI здесь либо перепевает существующую литературу, либо галлюцинирует.
Категория B — недопредставлен в обучающих данных. Редкие болезни, неонатальная медицина, новые материалы без аналогов, специализированные подобласти. Сдвиг распределения делает предсказания ненадёжными.
Категория C — проверяемость не может быть выполнена независимо. Рецензирование, сети цитирования, исторические утверждения. AI-сгенерированный контент становится самореализующимся — это и есть проблема NeurIPS.
Категория D — этический риск. AI как соавтор, нераскрытое использование, AI-генерация клинических рекомендаций без надзора, фабрикация данных.
И бонус — категория E — закрытая физика лучше доступна. Если есть DFT, согласованный фильтр, классический статистический тест — используйте его. AI добавлять только если он измеримо улучшает по сравнению с классическим эталоном.
Применение. Возьмите ваш конкретный случай. Пройдите по пяти категориям. Несколько срабатываний — сильный сигнал против AI.
WE-3: катализатор окисления пропилена¶
Третий разобранный пример. Показывает, как правильно работать с AI в науках о материалах.
Контекст. Руководитель просит построить AI-конвейер для катализаторов окисления пропилена. Промышленный процесс — семь миллионов тонн ежегодно глобально.
Пятишаговая рамка.
Шаг первый — классификация задачи. Закрытый мир. Катализ — квантовая химия хорошо определена, стабильность через DFT. AI может работать как расширение.
Шаг второй — карта альтернатив. DFT первого принципа через VASP. GP-BO над пространством параметров реакции. Обратное проектирование в стиле GNoME. Запросы Materials Project плюс Open Catalyst Project.
Шаг третий — применение четырёх критериев. Открытый мир — нет. Покрытие — Materials Project содержит миллион двести тысяч точек, в основном переходные металлы; окисление пропилена недопредставлено. Флаг риска. Проверяемость — да. Этика — да. Вердикт. AI применим с тщательным HITL и DFT-проверкой.
Шаг четвёртый — проектирование HITL. AI просматривает пять тысяч кандидатов через GNoME-вывод, один час GPU. Около пятисот с разумной композицией. Человек выбирает топ-50 по синтезируемости, стоимости прекурсоров, новизне. DFT валидирует пятьдесят, пятьдесят GPU-часов. Топ-10. Синтез в лаборатории подтверждает три.
Шаг пятый — проверка до публикации. Для каждого нового катализатора — DFT-стабильность плюс синтез плюс XRD плюс тест каталитической активности через термогравиметрический анализ. Все четыре подтверждены до подачи статьи.
[пауза]
Итог. Не «AI делает открытие». А «AI ускоряет скрининг, человек отбирает, DFT проверяет, лаборатория подтверждает». Временная шкала — четыре месяца для трёх подтверждённых катализаторов. Ручной подход — один-два кандидата в год. Ускорение в 4-6 раз, со шлюзами проверки.
Пять зрелых альтернатив: 30-70 лет каждая¶
Пять не-AI альтернатив, которые работают сегодня.
Первая — байесовская оптимизация плюс гауссовский процесс. Сорок плюс шестьдесят лет. Планирование экспериментов, оптимизация катализаторов, разработка лекарственных формуляций. Ускорение в пять-десять раз против ручного подхода.
Вторая — DFT плюс молекулярная динамика первого принципа. Шестьдесят плюс шестьдесят лет. Нобелевская премия девяносто восьмого. Катализ, материалы, разработка лекарств, структурная биология. Физическая обоснованность. Когда вы используете DFT, ошибки хорошо охарактеризованы и предсказуемы.
Третья — классические статистические методы. Сто плюс лет. T-тест Госсета тысяча девятьсот восьмого. ANOVA Фишера двадцать пятого. Интерпретируемость плюс принятие в рецензировании. Для задач объяснения — статистика лучше ML. Для задач предсказания — ML лучше. Это разные задачи, часто путаемые.
Четвёртая — исследование операций и OR-Tools. Семьдесят плюс лет. Симплекс Данцига сорок седьмого. Научная логистика, планирование клинических исследований, распределение грантов. Доказуемая оптимальность при заданных ограничениях.
Пятая — человеческое рецензирование с улучшениями. Не классический инструмент в техническом смысле, но зрелая институциональная инфраструктура. Структурированные рубрики, двойное слепое, statcheck, криминалистика изображений. Комбинированное человек плюс инструмент лучше каждого по отдельности.
[пауза]
Принцип сохранения. Зрелые методы редко устаревают. Они становятся компонентами в более крупных конвейерах. Классическая статистика семидесятых всё ещё используется в двадцатых. DFT восьмидесятых — тоже. Навык в зрелых методах накапливается на всю карьеру.
Три вопроса к поставщику + пятишаговая рамка¶
Применимый артефакт. То, что вы уносите в кармане.
Когда поставщик продаёт «AI-инструмент для научной задачи X» — задайте три вопроса.
Вопрос первый — эталон до AI. «Какой был эталон до внедрения вашего инструмента? Какая точность, время, стоимость классического метода для той же задачи?» Если не может ответить — он не знает эталон или знает, но не хочет говорить. Красный флаг.
Вопрос второй — воспроизводимость. «Где опубликованы код, тренировочные данные, веса? Могу ли я воспроизвести ваши результаты на моих данных?» Если «проприетарно, не делимся» — структурная проблема для академического использования.
Вопрос третий — случаи провала. «Опишите случаи, где ваша модель работает плохо. Какая доля галлюцинаций? Какие распределения вне обучения?» Если «модель всегда работает хорошо» — окончательный красный флаг.
[пауза]
И пятишаговая рамка, синтез всей лекции.
Первое — классифицируй задачу: открытый или закрытый мир. Второе — карта альтернатив: BO, DFT, классическая статистика, OR-Tools. Третье — четыре критерия «AI не нужен». Четвёртое — дизайн HITL с явными шлюзами. Пятое — проверка до публикации через классический эталон.
Запишите эти пять шагов на отдельном листе бумаги. Положите в карман.
Российский контекст: AIRI / Sber / Yandex + Указ № 490¶
Российский контекст. Что меняет для применимости предыдущих разделов.
AIRI — Институт искусственного интеллекта, две тысячи двадцать первый год. Независимый исследовательский институт. Публикации в Nature Communications по предсказанию структуры белка — открытые конкуренты AlphaFold. Сотрудничество с медицинскими центрами по AI в радиологии. Климатическое моделирование арктики. Направление — возникающие исследования, ещё не на промышленном масштабе.
Sber AI Lab. Исследовательское направление в Сбере. Применения AI4Science — климатическое моделирование, прогнозирование спроса на энергию. Внутренний кластер — около пяти тысяч H100. Один из немногих российских институтов, способных обучать крупные модели в масштабе.
Yandex Research. YaLM-100B — Yet Another Language Model, 100 миллиардов параметров, открыт в двадцать втором. Семейство RuGPT. Вклады в ICML, NeurIPS, ICLR. Наиболее международно-видимое российское направление AI-исследований.
Регуляторная рамка. Указ Президента номер 490 от 10 октября 2019 года — Национальная стратегия развития искусственного интеллекта до 2030 года. Обновлён Указом номер 124 от 15 февраля 2024 года. AI4Science — приоритетная категория РНФ.
[пауза]
Трещины. Разрыв в вычислениях. AlphaFold 3 — от десяти до пятидесяти миллионов долларов. Типичный грант РНФ — пятьдесят-сто пятьдесят тысяч. Структурный разрыв в 20-50 раз. Большинство групп зависят от открытых фундаментальных моделей — AlphaFold, Boltz-1, LLaMA.
Видимость цитирования. Русскоязычные публикации — менее одного процента Semantic Scholar при двух-трёх процентах мирового вывода. Трёхкратное недопредставление в данных языковых моделей. Российский аспирант не должен полагаться на NotebookLM или Elicit для покрытия русскоязычных источников.
Что это значит. Адаптация фундаментальных моделей, а не разработка с нуля. Географические преимущества — арктика, отечественные данные. Международная видимость через англоязычные публикации.
Q&A: завтра LLM-библиография от соавтора + позитивный recap¶
Это слайд Q&A. Возврат к провалу и встроенный позитивный повтор для нас с вами.
[медленно]
Завтра вы получаете LLM-сгенерированную библиографию от соавтора. Что делаете?
Шаг первый — проверяем каждую цитату через разрешение DOI. Десять минут.
Шаг второй — выборка десять случайных цитат на релевантность. Тридцать минут.
Шаг третий — GPTZero на стилистике. Пять минут.
Шаг четвёртый — запрашиваем исходные документы у соавтора.
Если три или более цитат проваливаются — отказываемся от соавторства. Это не нарушение вежливости. Это профессиональная строгость.
[пауза 2 сек]
И встроенный позитивный повтор. Чтобы вы не унесли из лекции только провалы.
AlphaFold — двести миллионов структур белков в открытой базе. Доступ любому студенту в любом университете мира. Это тысяча раз больше, чем PDB накопила за полвека.
Aurora — в пять тысяч раз быстрее эталона ECMWF на эталонном тесте. ECMWF AIFS оперативно с двадцать пятого февраля двадцать пятого года.
AlphaProof — серебро на IMO 2024. Четыре задачи из шести. Первый случай призового уровня для AI.
Эти результаты — реальные. AI в науке не «не работает». Он работает в задачах нобелевского уровня, когда применяется правильно. Закрытый мир плюс эталонная разметка плюс зрелая технология плюс HITL равняется расширение, ускоряющее научный рабочий процесс значимыми способами.
Главный тест, которому вы должны научиться, — различать работу, расширенную AI, от работы, загрязнённой AI. Это и есть то, что мы с вами сегодня прошли.
Вопросы — давайте.
Closing hero: AlphaFold → мост к Лекции 16¶
[медленно]
Эта обложка-композиция — белковые структуры AlphaFold. Символ закрытого мира научного цикла. Двести миллионов структур. Бесплатно. Открыто. Любому.
Биология теперь чуть больше известна. Но финальная карта далека — каждая предсказанная структура остаётся отправной точкой, не концом исследования.
[пауза]
AlphaFold показал, что задачи закрытого мира в науке доступны AI. Но только при условии эталонной разметки плюс человека в петле плюс открытых весов. Эту формулу — закрытый мир плюс эталон плюс HITL плюс открытость — вы уносите как главное оружие инженера.
Лекция шестнадцать — AI в нефтегазовой отрасли.
Это интересный случай, потому что задачи здесь частично закрытого мира — геофизика, моделирование подповерхности на основе физики. И частично открытого мира — характеризация резервуара, оценка риска разведки, много неопределённости. Та же лестница цикла применима, но с другой структурой успеха и провала.
[пауза]
Давайте посмотрим на прямую аналогию. На ступени Experiment в Лекции пятнадцать AI работает в закрытом мире — AlphaFold. В нефтегазе аналог — сейсмическая интерпретация через CNN на сейсмограммах. На ступени Hypothesis AI продаёт автономию — Sakana. В нефтегазе аналог — оценка риска разведки, где вендоры продают «прогноз нахождения нефти», но реальная работа требует геологической экспертизы.
Та же рамка. Другая отраслевая специфика. Инженер, научившийся различать сегодня, готов различать завтра.
До встречи на следующей лекции.
[Заключительная пауза]






































