Работа посвящена построению управления на основе алгоритма обучения с подкреплением для непрерывной системы и его сравнению с классическим методом дискретно-непрерывного управления. Дискретно-непрерывное управление расширяет классические методы, позволяя изменять управляющий сигнал внутри интервала дискретизации. Это повышает точность, однако требует знания параметров системы, что ограничивает его применение в условиях неопределенности. В качестве более современного и адаптивного метода рассмотрен подход на основе данных с использованием алгоритма off-policy Q-learning, который не требует априорной идентификации модели и знания точных параметров управляемого объекта, а обучается непосредственно на измеренных данных. Показано, что последовательность коэффициентов усиления имеет передел, при этом каждый элемент последовательности будет стабилизировать замкнутую систему. Разработанный алгоритм управления обладает свойством робастности. Проведено численное моделирование для системы двойного интегратора, демонстрирующее эффективность обоих методов, а также эксперимент с воздействием шума на модель. Выполнены анализ и сравнение обоих алгоритмов. Практическая часть реализована на языке программирования Python с использованием общедоступных библиотек NumPy, SciPy, Matplotlib и Seaborn
Рассмотрена линейная дискретная стационарная система с мультипликативными шумами и управлением, находящаяся под влиянием внешнего возмущения из специального класса. Описание динамики выбранного объекта управления производится в пространстве состояний. Класс внешних возмущений содержит множество стационарных гауссовских последовательностей с ограниченным уровнем средней анизотропии. В качестве критерия качества управления выбрана анизотропийная норма замкнутой управлением системы. Требуется предложить схему управления на основе динамического звена, при замыкании которым анизотропийная норма была бы ограничена минимально возможным числом. На первом этапе решения задачи выписывается динамика управления и производится расширение рассматриваемого объекта. На основе критерия ограниченности анизотропийной нормы в терминах матричных неравенств выписываются достаточные условия существования решения выпуклой задачи оптимизации, в которой минимизируется верхняя граница анизотропийной нормы. В полученных неравенствах производится специальная замена переменных, чтобы избавиться от нелинейной зависимости по неизвестным матрицам регулятора. После линеаризующей обратимой замены переменных производится численное решение задачи оптимизации стандартными методами. На последнем этапе производится вычисление матриц регулятора в пространстве состояний, гарантирующего ограниченность анизотропийной нормы замкнутой этим регулятором системы.