AI-пайплайн для discovery-задач в ВКР: от гипотезы до валидации модели
Поддомен: AI/ML. Роль автора: Data/ML-инженер. Схема подачи: C (вопросы → темы → реализация).
Введение
В свежем выпуске The Download сразу три сюжета складываются в один тренд: SES AI — производитель литиевых батарей из Массачусетса — полностью разворачивается от железа к AI-поиску новых материалов. Калифорнийский стартап Axiom Math выпускает бесплатный инструмент, который ищет математические закономерности там, где человек их ещё не замечал. А «AI Scientist» впервые прошёл peer review — то есть ИИ-агент, автоматизирующий научный цикл, больше не концепт, а рабочий инструмент.
Для выпускника ИТ-специальности это означает простую вещь: работодателю и комиссии уже недостаточно модели, обученной на Kaggle-датасете. Нужна воспроизводимая цепочка «данные → признаки → модель → интерпретация → мониторинг», привязанная к предметной области. Именно такая цепочка превращает диплом в защищаемый проект, а не в пересказ статьи. Если вы ищете, как написать ВКР по AI/ML, чтобы её не разнесли на предзащите, — читайте дальше.
Частые вопросы студентов по AI/ML-дипломам
1. Что выбрать для ВКР: классический ML или LLM-агент?
Смотрите на наличие данных. Если у вас есть структурированный датасет хотя бы на 5–10 тыс. записей с целевой переменной — берите классику (градиентный бустинг, случайный лес, линейные модели). LLM-агент даёт «вау»-эффект на защите, но требует либо платного API, либо локального инференса с GPU, и легко скатывается в демонстрацию без измеримых метрик. Хороший компромисс — гибрид: LLM как генератор признаков или ассистент аннотации, классический ML — как основной предиктор.
2. Где брать датасет, чтобы его не забраковали?
Публичные репозитории (UCI ML, Papers with Code Datasets, Materials Project для AI-материаловедения, zbMATH и arXiv-корпуса для математических задач), корпоративные логи (если есть доступ от кафедры), синтетические данные с явно обоснованным генератором. Обязательно указывайте лицензию и способ получения — комиссия любит этот вопрос.
3. Как считать эффективность, если модель не даёт state-of-the-art?
Сравнивайтесь не с SOTA-статьями, а с базовыми линиями (baseline) и с бизнес-метриками. Для регрессии — RMSE, MAE, R²; для классификации — F1, ROC-AUC, PR-AUC; для ранжирования — NDCG. Плюс инженерные метрики: время инференса, потребление памяти, стоимость запроса. Комиссия ценит честный анализ ошибок выше красивого числа.
4. Нужна ли MLOps-часть в бакалаврской ВКР?
Минимум — да: разделение train/inference, фиксация версий данных и моделей, воспроизводимый запуск. Даже один dvc.yaml и MLflow-run поднимут работу на голову выше типичного «ноутбука в приложении». По опыту, именно MLOps-блок приносит максимум вопросов на защите — и максимум баллов.
Темы ВКР, которые вырастают из статьи
-
Тема 1. ML-модель прогноза свойств материала для электрохимии. Отсылка к SES AI: компания ушла в AI, потому что перебор материалов датасетом ускоряется в разы.
Цель: построить регрессионную модель, предсказывающую ёмкость/проводимость по составу и структуре.
Задачи: собрать данные из Materials Project, провести feature engineering по кристаллической решётке, сравнить 3–4 модели (Ridge, RandomForest, XGBoost, GNN), провести валидацию и SHAP-анализ.
Структура: Гл.1 — обзор AI-материаловедения и постановка; Гл.2 — пайплайн и архитектура; Гл.3 — эксперименты, метрики, обсуждение ошибок. -
Тема 2. AI-ассистент поиска математических закономерностей. По мотивам Axiom Math: инструмент ищет скрытые связи в последовательностях и структурах.
Цель: спроектировать систему, которая по выборке числовых последовательностей предлагает гипотезы (OEIS-подобно) с оценкой правдоподобия.
Задачи: сформировать корпус последовательностей, обучить символьный регрессор, реализовать ранжирование гипотез, оценить точность через Top-k.
Структура: Гл.1 — символьный регресс и нейро-символьные методы; Гл.2 — архитектура, C4-диаграмма; Гл.3 — валидация на контрольной выборке. -
Тема 3. MLOps-платформа для автоматизации научных экспериментов. Прямая отсылка к «AI Scientist», прошедшему peer review.
Цель: реализовать сервис, который по конфигу эксперимента запускает обучение, собирает метрики и формирует отчёт.
Задачи: развернуть MLflow, DVC и FastAPI; реализовать оркестрацию (Airflow/Prefect); настроить трекинг дрейфа данных; подготовить REST-API.
Структура: Гл.1 — обзор MLOps и Process/People/Tools; Гл.2 — проектирование сервиса; Гл.3 — нагрузочное тестирование и SLO. -
Тема 4. Система мониторинга дрейфа данных для ML-модели в проде.
Цель: обнаруживать деградацию модели до падения бизнес-метрик.
Задачи: реализовать PSI/KL-дивергенцию, настроить алерты через Prometheus + Grafana, провести имитационные эксперименты с drift.
Структура: Гл.1 — типы дрейфа и требования ISO/IEC 25010; Гл.2 — архитектура наблюдаемости; Гл.3 — эксперименты и метрики MTTD.
Как встроить материал статьи в главы ВКР
Глава 1: анализ предметной области
Кейс SES AI используйте как аргумент актуальности:Western-производители батарей разоряются, а те, кто перестраивают R&D под AI-поиск материалов, получают конкурентное преимущество. Добавьте в обзор 2–3 абзаца о Materials Project, GNoME от DeepMind и подобных проектах. Обязательно постройте диаграмму Исикавы «почему классический R&D тормозит» — комиссия любит причинно-следственные схемы.
Глава 2: проектирование пайплайна
Здесь вы описываете архитектуру. Формат C4 (Context → Container → Component) — золотой стандарт для ML-систем: он показывает не только код, но и место человека, внешние источники данных, хранилище признаков. Минимум три диаграммы:
- Context: пользователь-химик, внешний датасет, система ML-сервиса;
- Container: API, Feature Store, Training Worker, Model Registry, Monitoring;
- Component: внутри Training Worker — препроцессинг, обучение, оценка.
Не забудьте про UML Sequence для сценария «запрос предсказания» — он снимает половину вопросов на защите.
Глава 3: эксперименты и метрики
Зафиксируйте версии всех экспериментов. Базовый шаблон dvc.yaml:
stages:
featurize:
cmd: python src/featurize.py
deps:
- data/raw/materials.csv
outs:
- data/features.parquet
train:
cmd: python src/train.py
deps:
- data/features.parquet
outs:
- models/model.pkl
metrics:
- metrics.json:
cache: false
А так выглядит минимальный трекинг через MLflow:
import mlflow, json
from sklearn.ensemble import GradientBoostingRegressor
with mlflow.start_run(run_name="gbm-baseline"):
model = GradientBoostingRegressor(n_estimators=500, max_depth=4)
model.fit(X_train, y_train)
rmse = ((model.predict(X_val) - y_val) ** 2).mean() ** 0.5
mlflow.log_param("n_estimators", 500)
mlflow.log_metric("rmse", rmse)
mlflow.sklearn.log_model(model, "model")
Метрики сравнения сведите в таблицу и обязательно добавьте интерпретацию: почему выиграл тот или иной алгоритм, где модель ошибается чаще, как это связано с физикой предметной области.
| Метрика | Что показывает | Где использовать |
|---|---|---|
| RMSE / MAE | Ошибка регрессии в единицах целевой переменной | Прогноз свойств материалов |
| R² | Доля объяснённой дисперсии | Сравнение моделей между собой |
| F1 / PR-AUC | Баланс точности и полноты | Классификация дефектов |
| Top-k accuracy | Попадание в k лучших гипотез | Поиск математических закономерностей |
| Latency / p95 | Время отклика инференса | SLO сервиса |
| PSI | Сдвиг распределения признаков | Мониторинг дрейфа |
Чему вы научитесь на такой ВКР
- Проектировать ML-пайплайны в терминах C4 и UML, а не «на словах».
- Воспроизводить эксперименты через DVC + MLflow — навык, который ценится на любой ML-вакансии.
- Валидировать модели с учётом предметной области и объяснять ошибки через SHAP/LIME.
- Настраивать мониторинг дрейфа и SLO для ML-сервиса.
- Оформлять ТЗ, архитектурные схемы и приложения по ГОСТ 34 и ГОСТ 19.
FAQ (продолжение)
Сколько экспериментов нужно в Главе 3?
Минимум 6–8: baseline + 3–4 модели + ablation-эксперименты (без того или иного блока признаков) + проверка на дрейфе. Комиссия проверяет наличие систематичности, а не количество.
Можно ли использовать готовые AutoML-сервисы?
Да, но обязательно сравните AutoML с вашей ручной моделью и объясните, почему выбрали то или иное решение. «Просто подключил AutoGluon» — не аргумент, «AutoGluon дал R²=0.87, моя GBM с подобранными признаками — 0.89 при в 3 раза меньшем времени инференса» — сильный аргумент.
Как оформлять схемы, если нет Visio?
Mermaid, PlantUML и draw.io — прямой путь: они хранятся в репозитории рядом с кодом, что само по себе плюс к воспроизводимости. Экспорт в SVG/PNG попадает в приложение, а исходник — в git.
Типичные ошибки студентов
- Обучили только одну модель и назвали её «оптимальной». Как SES AI не пошёл бы в AI только с одной архитектурой, так и в ВКР нужна сетка экспериментов. Избежать: минимум 3 алгоритма + baseline + обсуждение.
- Метрики без интерпретации. Таблица RMSE = 0.12 ничего не значит без объяснения, почему именно такая ошибка критична для задачи. Сравнивайте с физически осмысленным порогом.
- Нет воспроизводимости. Если PDF с работой есть, а пайплайн не запускается без ваших локальных файлов — минус балл. Решение:
dvc.yaml,requirements.txt, зафиксированный seed, Docker-образ.
Чек-лист перед сдачей
- Ключевые слова темы совпадают в названии, задачах, выводах и приложении.
- Каждая задача из введения закрыта отдельным разделом или экспериментом.
- Схемы подписаны и пронумерованы, есть ссылки в тексте.
- Метрики вынесены в сводную таблицу с оговорёнными единицами измерения.
- Оформление титульного листа, ссылок и списка литературы по ГОСТ 7.32 и требованиям кафедры.
- Приложение содержит листинги, конфиги (
dvc.yaml,requirements.txt) и метрики экспериментов. - Проверена уникальность с сохранением технических терминов и названий методов.
Если по теме нужно ускориться: наши инженеры помогают с проектированием пайплайнов, подбором метрик и грамотным оформлением. 120 часов консультаций, бесплатный первичный разбор вашей темы и поддержка на любом этапе — от постановки задачи до предзащиты. Оставьте заявку, и мы вместе посмотрим, где ваша работа провисает.
Источник: The Download: a battery pivot to AI, and rewriting math (опубликовано 2026-03-26)