Система классификации документов с маркшейдерскими данными
Где читать
Реклама. ООО ЛИТРЕС, ИНН 7719571260, erid: 2VfnxyNkZrY
О книге
Все предприятия, осуществляющие геологоразведочные работы на территории РФ, сталкиваются с необходимостью формирования задач для маркшейдерской службы и контроля выполнения поставленных задач. Это отражается в процессах документооборота предприятий. В данной связи существует проблема организации эффективной обработки документов в системах электронного документооборота – своевременного выявления документов, содержащих маркшейдерские данные. В статье представлено возможное решение указанной проблемы – автоматизированная система классификации документов в СЭД в виде рекомендательной надстройки над системой 1С:Документооборот. В рамках создания системы классификации был разработан и реализован сценарий предварительной обработки первичных текстов документов, включающий очистку, лемматизацию и удаление стоп-слов, а также подготовку входных признаков для классификатора. Исследована применимость различных алгоритмов машинного обучения к решению рассматриваемой задачи классификации, определены значения гиперпараметров, обеспечивающие наибольшее значение метрики ROC AUC. Выполнена оценка качества всех полученных моделей с использованием метрик Precision, Recall и F-меры, исследована устойчивость качества классификации к изменению входных данных. Выявленная проблема нестабильности результатов классификации решалась путем построения модели машинного обучения в виде ансамбля классификаторов. Обученная модель (ансамбль классификаторов) тестировалась на наборе реальных документов ООО «Газпром недра»; качество классификации на тестовой выборке по метрике ROC AUC составило 0,91. Кроме собственно модуля классификации разработанная система включает базу данных хранения результатов обучения, библиотеку функций для организации работы с базой данных, а также API-интерфейсы, позволяющие обрабатывать запросы на классификацию, приходящие из внешних систем. В API-интерфейсах, в частности, реализованы возможности загрузки сохраненных обученных моделей, валидации данных, приходящих из внешних систем, предварительной обработки входных текстовых документов, обучения новых моделей и оценки их качества, сохранение как обученных моделей, так и результатов их тестирования. Реализована возможность дообучения сохраненных моделей на новых данных.
Подробности
- Автор
- В. В. Еремеев
- Издательство
- Синергия
- Год издания
- 2022
- Объём
- 16 стр.
- Формат
- PDF-книга
Серия «Прикладная информатика. Научные статьи»: порядок чтения
Вся серия →- Книга 1 Инструменты нагрузочного тестирования 2018
- Книга 2 Корреляционный анализ и прогнозирование SYN-флуд атак 2018
- Книга 3 Менеджер событий на языке C# в Unity3D: разработка, оценка удобства использования и производительности 2016
- Книга 4 Разработка архитектуры интернет-сервиса организации научных мероприятий с автоматизацией документооборота 2018
- Книга 5 ITSM-подход в управлении ИТ-инфраструктурой сети МПК 2015
- Книга 6 Управление аутсорсинговой компанией на основе саморегуляции 2013
- Книга 7 Технология blockchain и ее применение 2017
- Книга 8 Разработка информационной системы тестирования знаний студентов с использованием Delphi и MS SQL Server 2019
- Книга 9 Автоматизация планирования мелкосерийного производства сетевыми методами 2017
- Книга 10 Адаптация стандарта PRINCE2 для проекта внедрения MES-системы 2017
- Книга 11 Структуры механических торговых систем 2013
- Книга 12 Реализация нейронной сети для распознавания изображений с помощью технологии NVIDIA CUDA 2013
Похожие книги
Все книги жанра →