基于对称数据增强的深度确定性策略梯度用于固定翼飞机侧倾姿态控制
机器学习
2026-05-06 v4 人工智能
摘要
动力系统的对称性可用于状态转换预测并促进控制策略优化。本文利用系统对称性开发样本高效的离线强化学习方法。在马尔可夫决策过程(MDP)的对称性假设下,提出了对称数据增强方法。将增强样本整合到深度确定性策略梯度(DDPG)的数据集中,以提高其状态-动作空间覆盖率。此外,通过引入在增强样本上训练的第二个批评网络,提高了样本利用效率,形成双批评网络结构。验证了飞机模型具有对称性,飞行控制仿真结果表明,采用增强样本后策略收敛速度加快。
引用
@article{arxiv.2407.11077,
title = {Deep deterministic policy gradient with symmetric data augmentation for lateral attitude tracking control of a fixed-wing aircraft},
author = {Yifei Li and Erik-Jan van Kampen},
journal= {arXiv preprint arXiv:2407.11077},
year = {2026}
}