Рассматриваются особенности разработки систем интернет-мониторинга открытого типа с неограниченным количеством источников в условиях ограниченного объема систем хранения собранных данных. Цель работы — решение задачи формирования множества документов минимально необходимого размера (ядра документов), отвечающего требованиям репрезентативности и вариативности тем при мониторниге сети Интернет. Для формализации и решения поставленной задачи разработана теоретико-множественная модель ядра документов. Предложенный подход отличается использованием вытесняющего алгоритма, поддерживающего в базе данных наличие только актуальных документов в пределах доступного объема системы хранения данных. Приведены результаты эксперимента с использованием реальных данных, подтверждающие применимость разработанной модели. Предложенный подход может быть использован в ряде практических задач, в частности для поиска в сети Интернет сведений (документов, страниц), по которым отсутствует априорная информация, необходимая для поиска по ключевым словам
Идентификаторы и классификаторы
- SCI
- Электроника
Технологии сбора данных в сети Интернет в настоящее время являются технологиями общего назначения, решающими широкий спектр практических задач. Если в начале развития интернет-сетей краулер (программный робот, используемый для обнаружения новых страниц в Интернете, их загрузки и анализа) являлся определяющим признаком поисковой системы, то на нынешнем уровне развития Всемирной паутины эта технология используется даже в небольших проектах, требующих получения актуальных данных из внешних источников. Большинство практических задач решаются с использованием „закрытого“ (closed domain) мониторинга, при котором сбор данных ведется по конечному списку ресурсов либо конкретному набору документов (мониторинг социальных сетей [1], анализ бизнесактивности конкурентов [2], агрегирование новостей [3], анализ общественного мнения, аналитика изменения цен [4] и тому подобные задачи). Проблема решения задач при ограниченных ресурсах памяти рассматривалась, например, в [5—7] и до сих пор является актуальной, несмотря на все возрастающую емкость систем хранения данных
Если у вас возникли вопросы или появились предложения по содержанию статьи, пожалуйста, направляйте их в рамках данной темы.
Список литературы
1. Zachlod C., Samuel O., Ochsner A., Werthmüller S. Analytics of social media data - state of characteristics and application // Journal of Business Research. 2022. Vol. 144, P. 1064-1076. DOI: 10.1016/j.jbusres.2022.02.016 EDN: WPKNOB
2. Fink C., Toivonen T., Correia R. A., Di Minin E. Mapping the online songbird trade in Indonesia // Applied Geography. 2021. P. 134. DOI: 10.1016/j.apgeog.2021.102505 EDN: ZTWHGT
3. Han H., Wang C., Zhao Y., Shu M., Wang W., Min Y. SSLE: A framework for evaluating the “Filter bubble” effect on the news aggregator and recommenders // World Wide Web. 2022. N 25(3). P. 1169-1195. DOI: 10.1007/s11280-022-01031-4 EDN: DVEPAQ
4. Krewinkel A., Sünkler S., Lewandowski D. et al. Concept for automated computer-aided identification and evaluation of potentially non-compliant food products traded via electronic commerce // Food Control. 2016. N 61, P. 204- 212. DOI: 10.1016/j.foodcont.2015.09.039 EDN: VGEYYZ
5. Беляевский К. О. Формирование октодерева по облаку точек при ограничении объема оперативной памяти // Научно-технический вестник СПбПУ. Информатика. Телекоммуникации. Управление. 2019. Т. 12, № 4. С. 97-110.
6. Puzak T.R. Analysis of Cache Replacement-Algorithms: Doctor’s Thesis. 1985.
7. Wilson P. R. et al. Dynamic storage allocation: A survey and critical review // Lecture Notes in Computer Science (Including Subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics). 1995. Vol. 986. P. 1-116.
8. Laliwala Z., Shaikh A. Web Crawling and Data Mining with Apache Nutch. Packt Publ., 2013.
9. Nasraoui O. Web data mining: exploring hyperlinks, contents, and usage data // ACM SIGKDD Explorations Newsletter. 2008.
10. Van den Broucke S., Baesens B. From Web Scraping to Web Crawling. Practical Web Scraping for Data Science. Berkeley, CA: Apress, 2018. P. 155-172.
11. Alkalbani A. M., Hussain W., Kim J. Y. A Centralised Cloud Services Repository (CCSR) Framework for Optimal Cloud Service Advertisement Discovery from Heterogenous Web Portals // IEEE Access. 2019. Vol. 7. P. 128213- 128223. DOI: 10.1109/ACCESS.2019.2939543
12. Wu Z., Cai Z., Tang, X., Xu Y., Deng T. A forward and backward private oblivious RAM for storage outsourcing on edge-cloud computing // Journal of Parallel and Distributed Computing. 2022. Vol. 166. P. 1-14. DOI: 10.1016/j.jpdc.2022.04.008 EDN: OCUDSD
13. Зайцева А. А., Кулешов С. В., Михайлов С. Н. Метод оценки качества текстов в задачах аналитического мониторинга информационных ресурсов // Тр. СПИИРАН. 2014. Вып. 37. C. 144-155. EDN: TELOJR
14. Кулешов С. В., Зайцева А. А., Левашкин С. П. Технологии и принципы сбора и обработки неструктурированных распределенных данных с учетом современных особенностей предоставления медиаконтента // Информатизация и связь. 2020. № 4. С. 62-66.
15. Kuleshov S., Zaytseva A., Aksenov A. Natural Language Search and Associative-Ontology Matching Algorithms Based on Graph Representation of Texts // Intelligent Systems Applications in Software Engineering, CoMeSySo 2019; Advances in Intelligent Systems and Computing. 2019. Vol. 1046. P. 7-26. DOI: 10.1007/978-3-030-30329-7_26 EDN: KUQXSR
Выпуск
Другие статьи выпуска
Для решения проблемы автоматического распознавания лиц людей, использующих такие средства индивидуальной защиты, как медицинская маска, предложен и апробирован новый подход, основанный на применении методов генерации синтетических изображений частично скрытых лиц и модели распознавания лиц ArcFace. Предложена стратегия формирования обучающих наборов данных и получен ряд соответствующих моделей распознавания. Проведена серия экспериментов, направленных на оценку качества предсказаний полученного решения, и установлена зависимость между результирующим качеством предсказаний, реализуемых моделями распознавания, и объемом синтетических изображений в обучающих наборах данных. Согласно результатам экспериментальных исследований, нейросетевые модели, дообученные на наборах данных, в которых объем искусственно синтезированных изображений составляет 40—60 %, демонстрируют более высокие значения показателя точности распознавания, выше 87 % по количественной метрике AAc (Averaged Accuracy). Использование предложенного подхода позволяет значительно улучшить качество распознавания частично скрытых лиц по сравнению с базовым подходом.
Для решения задачи корреляции событий информационной безопасности предложена модель комбинированного применения интеллектуальных методов корреляции. Интеллектуальные методы корреляции событий безопасности способны анализировать как объемные исторические данные, так и события в реальном времени, а также автоматически обнаруживать изменяющиеся пороговые значения. Предложенная модель содержит два уровня обработки данных: уровень представления знаний и уровень корреляции событий безопасности. На уровне представления знаний осуществляется структурный и семантический анализ событий. На уровне корреляции для обработки событий применяются оценка подобия элементов векторов событий безопасности, нейросетевой графо-ориентированный метод и анализ данных при помощи рекуррентных нейронных сетей. Результатами работы модели являются последовательность взаимосвязанных событий безопасности, тип текущего состояния безопасности системы и прогнозируемые состояния. Эффективность подхода на основе предложенной модели проиллюстрирована результатами эксперимента по прогнозированию событий безопасности системы, показывающими низкие значения показателя ошибок
Заготовка кормов из трав рассматривается как сложный технико-технологический процесс. Конечный продукт, в данном случае заготовка силоса, может быть получен с использованием разных вариантов технологий кормопроизводства. Представлен подход к выбору наиболее приемлемого варианта технологий и планов производства кормов из трав на основе логико-динамических и нечетко-возможностных моделей. Разработанный комплекс моделей и алгоритмов позволяет с системно-кибернетических позиций описать и исследовать существующие взаимосвязанные многоэтапные процессы производства кормов из трав при переводе объекта управления (сельскохозяйственного предприятия, производящего корма) из заданного исходного состояния в заданное конечное в зависимости от конкретных сценариев изменения внешних условий. В качестве основных внешних условий рассматриваются факторы, связанные с агробиологическими, временными, климатическими, экономическими и организационными ограничениями. Для решения задач предложены нечетко-возможностные модели оценивания урожайности кормовых угодий и качества выращенной кормовой массы. При анализе эффективности процессов кормопроизводства важным вопросом является многокритериальное оценивание качества, а также соответствующих программ проактивного управления процессом заготовки силоса с учетом следующих показателей: своевременности выполнения операций при различных условиях, степени равномерности использования ресурсов и общего времени заготовки кормов из трав. Предложены оригинальный математический анализ рассматриваемых процессов и алгоритмы решения задач прогнозирования и планирования заготовки кормов
Рассматривается пример создания подсистемы принятия управленческих решений в общей структуре поддержания вертикально-интегрированных объектов хозяйственной деятельности в работоспособном состоянии как элемента комплексно и целенаправленно усложняемой архитектуры информационноуправляющих систем. Представленный подход базируется на разрабатываемой авторами методологии управления сложностью, которая положена в основу методического подхода, обосновывающего порядок планомерной и эволюционной замены на производственных объектах лиц, принимающих решения, на функционально эквивалентные информационно-управляющие программно-аппаратные комплексы. Одним из наиболее эффективных методов формирования прозрачного механизма принятия управленческих решений, способного стать основным „решающим ядром“ (базой знаний) для подобных комплексов, является „нечетковозможностный подход“ (НВП). Эффективность данного подхода заключается в возможности с использованием экспертной информации восстановить сложную многосвязную функциональную зависимость между актуальными производственно-технологическими характеристиками исследуемого процесса и принимаемыми на их основе управленческими решениями. Приведен пример создания управляющей модели базы знаний для процесса с „кипящим слоем“
Представлен подход к планированию реконфигурации сложных многорежимных объектов в условиях заданной или неизвестной циклограммы режимов функционирования. Предложенный подход основан на концепции комплексного (системного) моделирования, концепции параметрического генома структуры с учетом функциональных и технологических особенностей исследуемого объекта. Наряду с классической „слепой“ технологией реконфигурации рассмотрена технология структурно-функциональной реконфигурации, реализующая смену структурных состояний исследуемых объектов как при возникновении нештатных ситуаций, так и в процессе планового функционирования в целях повышения надежности и увеличения сроков функционирования объектов за счет равномерной нагрузки элементов. Проведен сравнительный анализ результатов планирования реконфигурации сложных многорежимных объектов на основе указанных технологий, продемонстрировавший преимущество технологии структурно-функциональной реконфигурации
Рассматривается проблема объединения моделей классификации и упорядочения объектов в рамках одной системы поддержки принятия решений. Проблема решается путем поиска сходства и различия соответствующих моделей с применением методов системного анализа. Рассмотрены связи между моделями классификации с четкими и нечеткими границами классов, моделями упорядочения объектов с жесткими и мягкими ограничениями к значениям показателей. Введено понятие реальной цели, позволяющее связать между собой методы многоцелевой и условной оптимизации, а их, в свою очередь, с методами многомерной теории ценности и полезности. Трактуемая как граница между классами реальная цель позволяет связать методы классифицирования и упорядочения объектов. Найденные связи являются основанием для объединения рассмотренных методов в рамках общей системы поддержки принятия решений, что дает большие возможности для принятия решений разными методами и сопоставления получаемых результатов
Предложены математические модели для оценивания вклада системы эксплуатации в совокупную стоимость владения территориально распределенными техническими комплексами. Рассматриваются базовые стратегии организации технического обслуживания комплексов — плановая календарная и по фиксации отказов. Полученные результаты могут быть использованы для предварительного расчета эксплуатационных затрат и уточнения стоимости жизненного цикла комплексов при их разработке или приобретении.
Рассматриваются методологические и методические основы, использованные при создании отечественной информационно-аналитической платформы и соответствующих информационных систем. Указанная методология базируется на двух новых прикладных теориях: теории проактивного (упреждающего) управления жизненным циклом сложных технических объектов, а также дополняющей ее теории многокритериального оценивания и выбора наиболее предпочтительных моделей и полимодельных комплексов, описывающих функционирование сложных технических объектов и соответствующих информационно-аналитических систем. Последняя теория названа авторами квалиметрией моделей и полимодельных комплексов. Данные две теории вносят существенный вклад в развитие современной информатики: благодаря теории проактивного управления жизненным циклом сложных технических объектов современная информатика на конструктивном уровне обогащается методологией и методическим обеспечением, разработанным в классической кибернетике (обобщенной теории управления); благодаря разработанной квалиметрии моделей и полимодельных комплексов в информатике появился новый математический аппарат, позволяющий повысить обоснованность и качество проектных решений по созданию программно-математического обеспечения информационных систем, снизить стоимость их проектирования и эксплуатации. Приведены краткие сведения о практической реализации разработанных теорий
Издательство
- Издательство
- МИНОБРНАУКИ РОССИИ
- Регион
- Россия, Москва
- Почтовый адрес
- Тверская ул., д.11, г. Москва, ГСП- 3, 125993
- Юр. адрес
- 125009, г Москва, Тверской р-н, ул Тверская, д 11 стр 1, кв 4
- ФИО
- Фальков Валерий Николаевич (МИНИСТР)
- E-mail адрес
- info@minobrnauki.gov.ru
- Контактный телефон
- +7 (495) 5471316