Работа посвящена построению управления на основе алгоритма обучения с подкреплением для непрерывной системы и его сравнению с классическим методом дискретно-непрерывного управления. Дискретно-непрерывное управление расширяет классические методы, позволяя изменять управляющий сигнал внутри интервала дискретизации. Это повышает точность, однако требует знания параметров системы, что ограничивает его применение в условиях неопределенности. В качестве более современного и адаптивного метода рассмотрен подход на основе данных с использованием алгоритма off-policy Q-learning, который не требует априорной идентификации модели и знания точных параметров управляемого объекта, а обучается непосредственно на измеренных данных. Показано, что последовательность коэффициентов усиления имеет передел, при этом каждый элемент последовательности будет стабилизировать замкнутую систему. Разработанный алгоритм управления обладает свойством робастности. Проведено численное моделирование для системы двойного интегратора, демонстрирующее эффективность обоих методов, а также эксперимент с воздействием шума на модель. Выполнены анализ и сравнение обоих алгоритмов. Практическая часть реализована на языке программирования Python с использованием общедоступных библиотек NumPy, SciPy, Matplotlib и Seaborn
Идентификаторы и классификаторы
- SCI
- Физика
При рассмотрении задач управления в дискретном времени можно выделить два подхода. Первый — управление с нулевым порядком задержки (zero-order hold (ZOH)), который удерживает управляющее воздействие постоянным в течение каждого интервала выборки. Второй — дискретно-непрерывное управление (discrete-continuous (D/C)), который позволяет изменять управление внутри одного интервала выборки. Оба подхода улучшают качество управления и расширяют возможности управления системой [1]. Однако в последнее время все большее внимание уделяется методам управления, основанным на данных, которые позволяют минимизировать влияние погрешностей моделирования и адаптироваться к неопределенностям [2, 3]. Здесь под данными понимаются измеренные данные о состоянии системы и входных управляющих воздействиях. Эти данные о системе используются для построения стабилизирующего управляющего воздействия.
Если у вас возникли вопросы или появились предложения по содержанию статьи, пожалуйста, направляйте их в рамках данной темы.
Список литературы
1. Johnson C.D., Abdel-Haleem M. Optimal discrete-continuous control for the linear-quadratic regulator problem. Proc. 28th Southeastern Symposium on System Theory, 1996, pp. 184-188. DOI: 10.1109/SSST.1996.493495
2. Cheng S., Quilodran-Casas C., Ouala S., et al. Machine learning with data assimilation and uncertainty quantification for dynamical systems: a review. CAA J. Autom. Sin., 2023, vol. 10, iss. 6, pp. 1361-1387. DOI: 10.1109/JAS.2023.123537 EDN: OKBTED
3. Мыльников Л.А., Гергель Н.А., Кычкин А.В. и др. Использование динамических предиктивных моделей для управления техническими системами с инертностью. Вестник ПНИПУ. Электротехника, информационные технологии, системы управления, 2018, № 26, с. 77-91. EDN: XUEDGP
4. Van Waarde H.J., Eising J., Trentelman H.L., et al. Data informativity: a new perspective on data-driven analysis and control. IEEE Trans. Autom. Control, 2020, vol. 65, iss. 11, pp. 4753-4768. DOI: 10.1109/TAC.2020.2966717 EDN: RYKEAO
5. Berberich J., Romer A., Scherer C., et al. Robust data-driven state-feedback design. Proc. ACC, 2020, pp. 1532-1538. DOI: 10.23919/ACC45564.2020.9147320
6. Dorfler F., Coulson J., Markovsky I. Bridging direct and indirect data-driven control formulations via regularizations and relaxations. IEEE Trans. Autom. Control, 2023, vol. 68, iss. 2, pp. 883-897. DOI: 10.1109/TAC.2022.3148374 EDN: CIBTEX
7. Yang Y., Guo Z., Xiong H., et al. Data-driven robust control of discrete-time uncertain linear systems via off-policy reinforcement learning. IEEE Trans. Neural Netw. Learn. Syst., 2019, vol. 30, iss. 12, pp. 3735-3747. DOI: 10.1109/TNNLS.2019.2897814
8. Johnson C.D. A new discrete-time state model for linear dynamical systems with continuously-varying control/disturbance inputs. Proc. of the 1994 Southeastern Symposium on System Theory (SSST), 1994, pp. 523-527. DOI: 10.1109/SSST.1994.287821
9. Ogata K. Discrete-time control systems. Prentice-Hall, 1987.
10. Kuo B.C. Digital control systems. Oxford Univ. Press, 1992.
11. Dorato P., Levis A.H. Optimal linear regulators: the discrete-time case. EEE Trans. Autom. Control, 1971, vol. 16, iss. 6, pp. 613-620. DOI: 10.1109/TAC.1971.1099832
12. Sutton R.S., Barto A.G. Reinforcement learning: an introduction. MIT Press, 2018.
13. Watkins J., Dayan P. Q-learning. Mach. Learn., 1992, vol. 8, no. 3, pp. 279-292. DOI: 10.1007/BF00992698 EDN: NPYEIB
14. Willems J.C., Rapisarda P., Markovsky I., et al. A note on persistency of excitation. Syst. Control Lett., 2005, vol. 54, iss. 4, pp. 325-329. DOI: 10.1016/j.sysconle.2004.09.003
15. Bradtke S.J., Ydstie B.E., Barto A.G. Adaptive linear quadratic control using policy iteration. Proc. ACC, 1994, vol. 3, pp. 3475-3479. DOI: 10.1109/ACC.1994.735224
16. Lopez V.G., Alsalti M., Muller M.A. Efficient off-policy Q-learning for data-based discrete-time LQR problems. IEEE Trans. Autom. Control, 2023, vol. 68, iss. 5, pp. 2922-2933. DOI: 10.1109/TAC.2023.3235967 EDN: OULVMU
17. Любанович Б. Простой Python. СПб., Питер, 2020.
18. Бэрри П. Изучаем программирование на Python. М., Эксмо, 2020.
19. Idris I. NumPy beginner’s guide. Packt Publ., 2015.
20. Нуньес-Иглесиас Х., Уолт Ш., Дэшноу Х. Элегантный SciPy. М., ДМК Пресс, 2018.
21. Абдрахманов М.И. Python. Визуализация данных. Devpractice.ru, 2020.
Выпуск
Другие статьи выпуска
Приведены результаты исследования климатической стойкости полиэтилена низкого давления, содержащего стабилизирующие добавки различных марок. Экспонирование полиэтилена осуществлялось в условиях очень холодного климата (Якутск, Республика Саха (Якутия)). Согласно результатам исследования физико-механических характеристик, окислительная деструкция полиэтилена низкого давления начинается в процессе изготовления опытных образцов, что отражается на относительном удлинении при разрыве исходного образца после вальцевания. Введение стабилизирующих добавок положительно влияет на деформационные характеристики полимера, поэтому добавки выполняют функцию термостабилизации и пластификации. Показано, что на начальном этапе экспонирования (до шести месяцев) в материалах протекают преимущественно реакции межмолекулярного сшивания. Увеличение продолжительности испытаний приводит к преобладанию реакций разрыва полимерных цепей над реакциями сшивания, о чем свидетельствует резкое снижение вязкости расплава. В соответствии с результатами ИК спектроскопических исследований введение стабилизаторов приводит к изменению механизмов процессов, протекающих при старении. Климатическое старение полиэтилена низкого давления без стабилизаторов характеризуется преимущественным протеканием реакций диспропорционирования, сопровождающихся накоплением винильных групп, в то время как материалы со стабилизаторами проявляют склонность к накоплению карбонильных групп. По совокупности результатов исследования наилучшую стойкость к воздействию климатических факторов в условиях очень холодного климата, характеризующегося чрезвычайно низкими температурами в зимний период и высоким уровнем солнечной радиации, проявляют материалы, содержащие гибридные бифункциональные стабилизаторы марок СО-3 и СО-4
С использованием золь-гель метода получены фотокаталитические материалы на основе системы TiO2–SiO2/ZnO с содержанием компонентов 65–10–10 % (масс.) и с добавлением Р2О5 15 % (масс.). Устойчивость растворов во времени исследована методом вискозиметрии. Растворы пригодны для получения пленочных материалов в течение 5 сут. Условия и процессы формирования материалов зафиксированы с использованием синхронного термического анализа. Для достижения кристаллизации диоксида титана в анатазной фазе композиты подвергали ступенчатой термообработке при температуре 60, 300, 400, 500 и 600 and deg; С продолжительностью 30 мин каждая. Кислотно-основные свойства поверхности твердого тела оценены методом рН-метрии. В результате на поверхности образцов зафиксированы активные центры Льюиса (Si4+, Ti4+), что способствует повышению фотокаталитической активности. Структура и фазовый состав полученных материалов исследованы методами ИК-спектроскопии и рентгенофазового анализа. Фотокаталитическая активность образцов оценена фотометрическим методом. Показано, что ион Zn2+ положительно влияет на способность диоксида титана к образованию свободных носителей зарядов, необходимых для окисления различных органических загрязнителей. На основании полученных данных материалы могут быть использованы для дальнейших исследований в области фотокатализа и очистки окружающей среды
Разработана экспериментальная установка биосенсора с чувствительным элементом на базе биомембраны из фосфолипида 1,2-дифитаноил-sn-глицеро-3-фосфохолина для изучения ее взаимодействия с мембранным белком — цитохромом b5. Проведены исследования электрофизических характеристик биомембраны. Созданная установка позволяет регистрировать взаимодействие биомембраны (представляющей собой фосфолипидный бислой, сформированный в биосенсоре) с мембранным белком посредством измерения электрической проводимости биомембраны. Электрическую проводимость мембраны определяли при наличии белка и его отсутствии. Экспериментально продемонстрировано, что такой биосенсор позволяет определять взаимодействие цитохрома b5 с фосфолипидной мембраной в реальном времени. С использованием установки определено, что полноразмерный белок цитохром b5 (d-b5), содержащий в структуре гидрофобный домен, существенно влияет на проводимость мембраны, приводя к возникновению каналов проводимости. В случае отсутствия у цитохрома b5 мембранного фрагмента (t-b5) взаимодействие белка с липидным слоем практически не наблюдалось. Полученные результаты можно использовать при создании биосенсоров на базе липидных слоев для моделирования взаимодействия белков с липидными мембранами в организме человека
Рабочее тело, движущееся в нестационарном (пульсирующем) режиме, является основой многих технических и технологических установок. В связи с этим актуально уточнение физического механизма воздействия пульсаций и турбулизации потока на интенсивность теплоотдачи воздуха в канале для разных граничных условий посредством экспериментального подхода. Исследована прямая труба длиной 1300 мм и диаметром 30 мм (43 калибра). Опыты проведены в диапазоне чисел Рейнольдса Re = 10 000–140 000 (развитый турбулентный режим течения). Пульсации потока в канале создавались посредством заслонки, вращающейся с частотой 4…16 Гц. Степень турбулентности потока изменялась в пределах 4…12 % с использованием установки в трубу различных пластинчатых плоских вставок. Метод тепловой анемометрии использован для получения данных о нестационарных значениях скорости и локального коэффициента теплоотдачи. Показана степень влияния газодинамической нестационарности на интенсивность теплоотдачи в канале. Установлено, что рост степени турбулентности пульсирующего потока до 12 % увеличивает коэффициент теплоотдачи на 15…21 %. Определен максимальный рост интенсивности теплоотдачи (на 49…51 %) от совокупного воздействия пульсаций и турбулизации потока воздуха в канале. Полученные результаты применимы для отладки математических моделей и проектирования трубопроводных элементов технических систем с рабочим телом, движущимся в пульсирующем режиме
При изучении тонких плазменных неоднородных слоев, образующихся вблизи стенок электроразрядных устройств различных типов (поверхностей электродов, металлических и диэлектрических экранов), затруднительно, а иногда и невозможно, использовать традиционные методы активной (ленгмюровские и СВЧ-зонды) и оптической (спектроскопия) диагностики. Указанным методам присущи некоторые недостатки, связанные с возможным искажением исследуемой плазмы и относительно низким пространственным разрешением. Использование этих контактных методов в узких пристеночных слоях часто бывает ограничено большими тепловыми потоками, а применение пассивных оптических методов затруднено проблемой вывода излучения из очень малых областей. В неоднородной плазме существует связь между электромагнитными волнами, возбуждаемыми извне, и плазменными волнами (при условии наличия области, где фазовые скорости и частоты этих волн близки). Происходит трансформация падающей электромагнитной волны в плазменную и возможно проявление резонансных эффектов в плазменном образовании. Обоснована возможность использования резонансов Тонкса — Даттнера для диагностики пристеночных слоев плазмы и проведена численная проверка предложенной методики на экспериментальных данных
Усовершенствованный алгоритм оптимизации Cricetomys emini (ACEO) и усовершенствованный алгоритм оптимизации Dictyostelid (EDOA) применяются для снижения потерь активной мощности и повышения стабильности напряжения. Cricetomys emini в период размножения члены группы делятся информацией о пути, ведущем к обильному источнику питания. В разделе “Исследование”, если объективная функциональная ценность другого Cricetomys emini превышает функциональную ценность наиболее приспособленного Cricetomys emini (α-самца), то соответствующий Cricetomys emini обновляется, и местоположения других представителей в кластере используются на основе недавно признанного наиболее приспособленного Cricetomys emini. В разделе “эксплуатация” период размножения отличается от места обитания к месту обитания и обычно приходится на период дождей. Алгоритм оптимизации Cricetomys emini был объединен с алгоритмом оптимизации Caelifera, чтобы повысить эффективность поиска и избежать попадания в ловушку локальных оптимумов. Самцы Cricetomys emini чувствуют время размножения.
Исследована нелинейная модель сдвигового течения, описывающая взаимосвязь процесса деформации и эволюции структуры тиксотропной среды. Модель предназначена для описания поведения широкого класса материалов (от полимерных растворов и дисперсных систем до физических гелей и цементных суспензий) в условиях переменной деформации. В модели параметр структурированности влияет на вязкость и упругие свойства материала и подвержен изменению под действием напряжения. Рассмотрено циклическое нагружение в широком диапазоне частот и амплитуд, включая режимы осцилляционного сдвига малой и большой амплитуды (small amplitude oscillatory shear (SAOS), large amplitude oscillatory shear (LAOS)). Показано, что модель воспроизводит переход от линейного вязкоупругого поведения к нелинейному с характерными признаками разрушения и восстановления структуры в цикле. При этом форма интегральных кривых и фазовых траекторий существенно зависит от соотношения периода деформации и времени релаксации. Обнаружены эффекты осцилляций, асимметрии и сдвига фаз, связанные с перестройкой структуры, а также режимы с нарушением симметрии и изменением числа периодов параметра структурированности в пределах цикла. Результаты сопоставлены с экспериментальными данными для тиксотропных жидкостей, полимерных растворов, эмульсий и гелей. Показана применимость модели для описания ключевых нелинейных эффектов в реологических испытаниях циклической деформации
Издательство
- Издательство
- МГТУ им. Н.Э. Баумана
- Регион
- Россия, Москва
- Почтовый адрес
- 105005, г. Москва, вн. тер. г. муниципальный округ Басманный, ул. 2-я Бауманская, д. 5, с. 1
- Юр. адрес
- 105005, г. Москва, вн. тер. г. муниципальный округ Басманный, ул. 2-я Бауманская, д. 5, с. 1
- ФИО
- Гордин Михаил Валерьевич (Ректор)
- E-mail адрес
- bauman@bmstu.ru
- Контактный телефон
- +7 (499) 2636377
- Сайт
- https://bmstu.ru/