Публикации автора

ПРИМЕНЕНИЕ МЕТОДОВ СИНТЕЗА ОБУЧАЮЩИХ ДАННЫХ ДЛЯ РАСПОЗНАВАНИЯ ЧАСТИЧНО СКРЫТЫХ ЛИЦ НА ИЗОБРАЖЕНИЯХ (2022)

Для решения проблемы автоматического распознавания лиц людей, использующих такие средства индивидуальной защиты, как медицинская маска, предложен и апробирован новый подход, основанный на применении методов генерации синтетических изображений частично скрытых лиц и модели распознавания лиц ArcFace. Предложена стратегия формирования обучающих наборов данных и получен ряд соответствующих моделей распознавания. Проведена серия экспериментов, направленных на оценку качества предсказаний полученного решения, и установлена зависимость между результирующим качеством предсказаний, реализуемых моделями распознавания, и объемом синтетических изображений в обучающих наборах данных. Согласно результатам экспериментальных исследований, нейросетевые модели, дообученные на наборах данных, в которых объем искусственно синтезированных изображений составляет 40—60 %, демонстрируют более высокие значения показателя точности распознавания, выше 87 % по количественной метрике AAc (Averaged Accuracy). Использование предложенного подхода позволяет значительно улучшить качество распознавания частично скрытых лиц по сравнению с базовым подходом.

МУЛЬТИМЕДИЙНАЯ БАЗА ДАННЫХ ЖЕСТОВ РУССКОГО ЖЕСТОВОГО ЯЗЫКА В ТРЕХМЕРНОМ ФОРМАТЕ (2020)

Настоящая статья посвящена описанию мультимедийной базы данных (БД) “TheRuSLan” русского жестового языка (РЖЯ) и принципов ее фонетической аннотации. Особенностью заявленной БД является трехмерное (3D) представление жестов, что дает новые возможности лексикографического описания лексики и исследования особенностей артикуляции РЖЯ. Трехмерное представление жеста достигается за счет использования камеры Kinect 2.0, записывающей данные в высоком разрешении (FullHD), в режиме карты глубины и в инфракрасном диапазоне. БД представляет собой запись 164 лексических единиц и клауз в исполнении 13 информантов минимум в 5 итерациях. Общий размер файлов составляет 3,8 Тб в оригинальном формате, общая длительность видео - более 8 часов. В статье дается обзор существующих БД по РЖЯ, раскрывается содержание описываемого словаря, обрисовываются принципы лингвистической аннотации жестов и обосновывается набор признаков, используемых при аннотировании настоящей БД. Показано, что некоторые параметры жеста могут существенно варьировать от информанта к информанту, а именно: форма руки и локализация. Однако причины такой вариативности, ее масштабы и значение для описания РЖЯ являются делом дальнейших исследований.