Перейти к содержимому
Обложка книги «Программное извлечение данных из word-документов на основе ситуационно-ориентированного подхода»

Программное извлечение данных из word-документов на основе ситуационно-ориентированного подхода

Рейтинг Букли пока нет оценок
ЛитРес 5,0 2 оценки
Оцените книгу Войдите, чтобы оценить

Где читать

ЛитРесЭлектронная книга
Читать книгу

Реклама. ООО ЛИТРЕС, ИНН 7719571260, erid: 2VfnxyNkZrY

О книге

В статье рассмотрены вопросы применения ситуационно-ориентированного подхода для программной обработки word-документов. Рассматриваемые документы подготавливаются пользователем в среде текстового процессора Microsoft Word или его аналогов и используются в дальнейшем как источники данных. Открытость форматов Office Open XML и Open Document Format позволила применить концепцию виртуальных документов, отображаемых на ZIP-архивы, для программного доступа к XML-компонентам word-документов в ситуационно-ориентированной среде. Обоснована важность выработки предварительных соглашений относительно размещения информации в документе для последующего поиска и извлечения, например, с помощью заранее подготовленных шаблонов-заготовок. Для форматов DOCX и ODT рассмотрено использование ключевых фраз, закладок, элементов управления контентом, пользовательских XML-компонентов для организации извлечения введенных данных. Для каждого варианта построены древовидные модели доступа к извлекаемым данным, а также соответствующие XPath-выражения. Отмечено, что использование того или иного варианта зависит от функциональных возможностей и ограничений текстового процессора и характеризуется различной сложностью разработки шаблона-заготовки, внесения данных пользователем и программирования извлечения данных. Рассмотрен практический пример обработки метаданных научной статьи, подготовленной в среде Microsoft Word для публикации в научном журнале. Примененное решение основано на занесении метаданных в статью с помощью размещенных в шаблоне-заготовке элементов управления контентом, привязанных к элементам пользовательского XML-компонента. Разработанная иерархическая ситуационная модель HSM обеспечивает извлечение XML-компонента, загрузку его в DOM-объект и XSLT-преобразования для получения результирующих данных: отчета об ошибках и JavaScript-кода для последующего использования извлеченных метаданных.

Подробности

Автор
А. С. Гусаренко
Издательство
Синергия
Год издания
2022
Объём
18 стр.
Формат
PDF-книга

Серия «Прикладная информатика. Научные статьи»: порядок чтения

Вся серия →
  1. Книга 1 Инструменты нагрузочного тестирования 2018
  2. Книга 2 Корреляционный анализ и прогнозирование SYN-флуд атак 2018
  3. Книга 3 Менеджер событий на языке C# в Unity3D: разработка, оценка удобства использования и производительности 2016
  4. Книга 4 Разработка архитектуры интернет-сервиса организации научных мероприятий с автоматизацией документооборота 2018
  5. Книга 5 ITSM-подход в управлении ИТ-инфраструктурой сети МПК 2015
  6. Книга 6 Управление аутсорсинговой компанией на основе саморегуляции 2013
  7. Книга 7 Технология blockchain и ее применение 2017
  8. Книга 8 Разработка информационной системы тестирования знаний студентов с использованием Delphi и MS SQL Server 2019
  9. Книга 9 Автоматизация планирования мелкосерийного производства сетевыми методами 2017
  10. Книга 10 Адаптация стандарта PRINCE2 для проекта внедрения MES-системы 2017
  11. Книга 11 Структуры механических торговых систем 2013
  12. Книга 12 Реализация нейронной сети для распознавания изображений с помощью технологии NVIDIA CUDA 2013
Читали эту книгу? Напишите рецензию — она появится на этой странице. Войти и написать рецензию

Похожие книги

Все книги жанра →