СОВРЕМЕННЫЕ ПРОБЛЕМЫ КОМПЬЮТЕРНЫХ И ИНФОРМАЦИОННЫХ НАУК, IX МЕЖДУНАРОДНАЯ НАУЧНАЯ КОНФЕРЕНЦИЯ «КОНВЕРГЕНТНЫЕ КОГНИТИВНО-ИНФОРМАЦИОННЫЕ ТЕХНОЛОГИИ»

Размер шрифта: 
Методика оценки влияния качества данных на результативность моделей машинного обучения для определения опозданий исполнения контрольных точек проектов
Евгений Витальевич Никульчев, Дмитрий Юрьевич Ильин, Сергей Евгеньевич Духовенский, Нурзия Шапиевна Газанова, Александр Александрович Червяков

Изменена: 2024-12-01

Реферат


В работе рассматривается процесс построения оценок возможности опоздания в сроках выполнения контрольных точек национальных и федеральных проектов на основе технологий машинного обучения. В федеральных информационных системах собраны большие объемы данных, в том числе о ходе выполнения национальных проектов, что позволяет их использовать для машинного обучения различных моделей. Одной из главных задач является контроль хода выполнения проектов и отслеживание хода проектов по заданным контрольным точкам. Несмотря на организационно-технические меры, наблюдаются опоздания в выполнении контрольных точек. Имеющиеся в системе мониторинга данные о причинах опозданий, позволили сформировать признаковое пространство и оценить степень их влияния на результат. Однако классическое применение подходов машинного обучения для решения задачи классификации на данных о контрольных точках, не позволяет получить результат пригодный для практического применения. Это объясняется наличием в исходных данных неоднозначностей. Как правило, методы машинного обучения демонстрируются и совершенствуются на типовых наборах данных, а в реальных системах качеству данных необходимо уделить существенное внимание. Исследование посвящено разработке методики оценки влияния качества данных на результативность моделей машинного обучения в задаче оценки выполнения или опоздания исполнения контрольных точек национальных и федеральных проектов. Результаты получены на реальных, обезличенных, пронормированных, закодированных данных федеральной системы мониторинга. Выявлены неоднозначности в данных и построена зависимость качества машинного обучения в зависимости от объема неоднозначных данных. Полученные результаты демонстрируют эффективность разработанной методики.