Сбербанк и AIRI представили открытый инструмент SplitLight для диагностики данных перед обучением ИИ-моделей
Ученые Центра практического искусственного интеллекта Сбербанка и Института AIRI разработали SplitLight — открытый инструмент для диагностики данных перед обучением и сравнением рекомендательных моделей. Он позволяет выявлять сбои в логировании, смещенные временные метки и дублирующиеся события, которые могут исказить итоговые метрики, а также оценивать применимость результатов экспериментов в реальных условиях.
SplitLight помогает обнаруживать дефекты в данных до запуска эксперимента, что особенно важно для продуктовых команд в маркетплейсах, стримингах и медиа. Инструмент также фиксирует ключевые статистические характеристики подхода к подготовке выборки, повышая воспроизводимость исследований и упрощая сопоставление результатов разных команд. Кроме того, система проверяет, не попали ли в обучающую выборку данные из будущего, учитываются ли новые пользователи и объекты, а также насколько различаются тренировочная и валидационная выборки.
Инструмент доступен в двух режимах: как библиотека на Python для разработчиков и как интерактивный веб-интерфейс, не требующий кода. Команда проекта во главе с исполнительным директором по исследованию данных Центра практического искусственного интеллекта Сбербанка Алексеем Васильевым протестировала SplitLight на шести популярных открытых наборах данных. Тестирование показало, что даже незначительные изменения в разбиении данных могут заметно повлиять на метрики и оценку качества модели.
Научная статья о разработке была представлена на ACM SIGIR 2026 — ведущей международной конференции уровня A*. По словам старшего управляющего директора, директора по AI-трансформации Сбербанка Сергея Рябова, инструмент снижает риск внедрения моделей, эффективных лишь на бумаге, и упрощает документирование и сравнение с публикациями для исследовательских групп.