AI-пайплайн для discovery-задач в ВКР: от гипотезы до валидации модели

Поддомен: AI/ML. Роль автора: Data/ML-инженер. Схема подачи: C (вопросы → темы → реализация).

Введение

В свежем выпуске The Download сразу три сюжета складываются в один тренд: SES AI — производитель литиевых батарей из Массачусетса — полностью разворачивается от железа к AI-поиску новых материалов. Калифорнийский стартап Axiom Math выпускает бесплатный инструмент, который ищет математические закономерности там, где человек их ещё не замечал. А «AI Scientist» впервые прошёл peer review — то есть ИИ-агент, автоматизирующий научный цикл, больше не концепт, а рабочий инструмент.

Для выпускника ИТ-специальности это означает простую вещь: работодателю и комиссии уже недостаточно модели, обученной на Kaggle-датасете. Нужна воспроизводимая цепочка «данные → признаки → модель → интерпретация → мониторинг», привязанная к предметной области. Именно такая цепочка превращает диплом в защищаемый проект, а не в пересказ статьи. Если вы ищете, как написать ВКР по AI/ML, чтобы её не разнесли на предзащите, — читайте дальше.

Частые вопросы студентов по AI/ML-дипломам

1. Что выбрать для ВКР: классический ML или LLM-агент?

Смотрите на наличие данных. Если у вас есть структурированный датасет хотя бы на 5–10 тыс. записей с целевой переменной — берите классику (градиентный бустинг, случайный лес, линейные модели). LLM-агент даёт «вау»-эффект на защите, но требует либо платного API, либо локального инференса с GPU, и легко скатывается в демонстрацию без измеримых метрик. Хороший компромисс — гибрид: LLM как генератор признаков или ассистент аннотации, классический ML — как основной предиктор.

2. Где брать датасет, чтобы его не забраковали?

Публичные репозитории (UCI ML, Papers with Code Datasets, Materials Project для AI-материаловедения, zbMATH и arXiv-корпуса для математических задач), корпоративные логи (если есть доступ от кафедры), синтетические данные с явно обоснованным генератором. Обязательно указывайте лицензию и способ получения — комиссия любит этот вопрос.

3. Как считать эффективность, если модель не даёт state-of-the-art?

Сравнивайтесь не с SOTA-статьями, а с базовыми линиями (baseline) и с бизнес-метриками. Для регрессии — RMSE, MAE, R²; для классификации — F1, ROC-AUC, PR-AUC; для ранжирования — NDCG. Плюс инженерные метрики: время инференса, потребление памяти, стоимость запроса. Комиссия ценит честный анализ ошибок выше красивого числа.

4. Нужна ли MLOps-часть в бакалаврской ВКР?

Минимум — да: разделение train/inference, фиксация версий данных и моделей, воспроизводимый запуск. Даже один dvc.yaml и MLflow-run поднимут работу на голову выше типичного «ноутбука в приложении». По опыту, именно MLOps-блок приносит максимум вопросов на защите — и максимум баллов.

Темы ВКР, которые вырастают из статьи

Как встроить материал статьи в главы ВКР

Глава 1: анализ предметной области

Кейс SES AI используйте как аргумент актуальности:Western-производители батарей разоряются, а те, кто перестраивают R&D под AI-поиск материалов, получают конкурентное преимущество. Добавьте в обзор 2–3 абзаца о Materials Project, GNoME от DeepMind и подобных проектах. Обязательно постройте диаграмму Исикавы «почему классический R&D тормозит» — комиссия любит причинно-следственные схемы.

Глава 2: проектирование пайплайна

Здесь вы описываете архитектуру. Формат C4 (Context → Container → Component) — золотой стандарт для ML-систем: он показывает не только код, но и место человека, внешние источники данных, хранилище признаков. Минимум три диаграммы:

Не забудьте про UML Sequence для сценария «запрос предсказания» — он снимает половину вопросов на защите.

Глава 3: эксперименты и метрики

Зафиксируйте версии всех экспериментов. Базовый шаблон dvc.yaml:

stages:
  featurize:
    cmd: python src/featurize.py
    deps:
      - data/raw/materials.csv
    outs:
      - data/features.parquet
  train:
    cmd: python src/train.py
    deps:
      - data/features.parquet
    outs:
      - models/model.pkl
    metrics:
      - metrics.json:
          cache: false

А так выглядит минимальный трекинг через MLflow:

import mlflow, json
from sklearn.ensemble import GradientBoostingRegressor

with mlflow.start_run(run_name="gbm-baseline"):
    model = GradientBoostingRegressor(n_estimators=500, max_depth=4)
    model.fit(X_train, y_train)
    rmse = ((model.predict(X_val) - y_val) ** 2).mean() ** 0.5
    mlflow.log_param("n_estimators", 500)
    mlflow.log_metric("rmse", rmse)
    mlflow.sklearn.log_model(model, "model")

Метрики сравнения сведите в таблицу и обязательно добавьте интерпретацию: почему выиграл тот или иной алгоритм, где модель ошибается чаще, как это связано с физикой предметной области.

МетрикаЧто показываетГде использовать
RMSE / MAEОшибка регрессии в единицах целевой переменнойПрогноз свойств материалов
R²Доля объяснённой дисперсииСравнение моделей между собой
F1 / PR-AUCБаланс точности и полнотыКлассификация дефектов
Top-k accuracyПопадание в k лучших гипотезПоиск математических закономерностей
Latency / p95Время отклика инференсаSLO сервиса
PSIСдвиг распределения признаковМониторинг дрейфа

Чему вы научитесь на такой ВКР

FAQ (продолжение)

Сколько экспериментов нужно в Главе 3?

Минимум 6–8: baseline + 3–4 модели + ablation-эксперименты (без того или иного блока признаков) + проверка на дрейфе. Комиссия проверяет наличие систематичности, а не количество.

Можно ли использовать готовые AutoML-сервисы?

Да, но обязательно сравните AutoML с вашей ручной моделью и объясните, почему выбрали то или иное решение. «Просто подключил AutoGluon» — не аргумент, «AutoGluon дал R²=0.87, моя GBM с подобранными признаками — 0.89 при в 3 раза меньшем времени инференса» — сильный аргумент.

Как оформлять схемы, если нет Visio?

Mermaid, PlantUML и draw.io — прямой путь: они хранятся в репозитории рядом с кодом, что само по себе плюс к воспроизводимости. Экспорт в SVG/PNG попадает в приложение, а исходник — в git.

Типичные ошибки студентов

  1. Обучили только одну модель и назвали её «оптимальной». Как SES AI не пошёл бы в AI только с одной архитектурой, так и в ВКР нужна сетка экспериментов. Избежать: минимум 3 алгоритма + baseline + обсуждение.
  2. Метрики без интерпретации. Таблица RMSE = 0.12 ничего не значит без объяснения, почему именно такая ошибка критична для задачи. Сравнивайте с физически осмысленным порогом.
  3. Нет воспроизводимости. Если PDF с работой есть, а пайплайн не запускается без ваших локальных файлов — минус балл. Решение: dvc.yaml, requirements.txt, зафиксированный seed, Docker-образ.

Чек-лист перед сдачей

  • Ключевые слова темы совпадают в названии, задачах, выводах и приложении.
  • Каждая задача из введения закрыта отдельным разделом или экспериментом.
  • Схемы подписаны и пронумерованы, есть ссылки в тексте.
  • Метрики вынесены в сводную таблицу с оговорёнными единицами измерения.
  • Оформление титульного листа, ссылок и списка литературы по ГОСТ 7.32 и требованиям кафедры.
  • Приложение содержит листинги, конфиги (dvc.yaml, requirements.txt) и метрики экспериментов.
  • Проверена уникальность с сохранением технических терминов и названий методов.

Если по теме нужно ускориться: наши инженеры помогают с проектированием пайплайнов, подбором метрик и грамотным оформлением. 120 часов консультаций, бесплатный первичный разбор вашей темы и поддержка на любом этапе — от постановки задачи до предзащиты. Оставьте заявку, и мы вместе посмотрим, где ваша работа провисает.

Материал подготовлен экспертами компании «Наименование сайта». Мы помогаем студентам с 2010 года: разрабатываем темы, подгоняем архитектуру под требования кафедры, консультируем по нормоконтролю и защите. Если вам нужна помощь в разработке темы или оформлении работы, наши специалисты готовы подсказать.

Последнее обновление: 2026-09-26

Источник: The Download: a battery pivot to AI, and rewriting math (опубликовано 2026-03-26)