DOA:一种基于深度强化学习的具有自适应位姿补偿能力的退化优化智能体
机器人学
2025-07-29 v1 机器学习
系统与控制
系统与控制
摘要
基于粒子滤波的二维同时定位与地图构建(2D-SLAM)因其高效性被广泛用于室内定位任务。然而,长直走廊等室内环境会导致SLAM出现严重的退化问题。在本文中,我们使用近端策略优化(PPO)训练一个自适应退化优化智能体(DOA)来解决退化问题。我们提出了一种系统性的方法论,以应对传统监督学习框架中的三个关键挑战:(1)退化数据集中的数据获取瓶颈,(2)训练样本固有的质量退化,以及(3)标注协议设计中的歧义性。我们设计了一个专门的奖励函数来引导智能体发展对退化环境的感知能力。利用输出的退化因子作为参考权重,智能体可以动态调整不同传感器对位姿优化的贡献。具体地,观测分布向运动模型分布偏移,步长由与退化因子相关的线性插值公式决定。此外,我们采用迁移学习模块赋予智能体跨环境的泛化能力,并解决在退化环境中训练的低效问题。最后,我们进行消融研究以证明模型设计的合理性和迁移学习的作用。我们还将所提出的DOA与最先进方法进行比较,以证明其在各种环境中优越的退化检测和优化能力。
引用
@article{arxiv.2507.19742,
title = {DOA: A Degeneracy Optimization Agent with Adaptive Pose Compensation Capability based on Deep Reinforcement Learning},
author = {Yanbin Li and Canran Xiao and Hongyang He and Shenghai Yuan and Zong Ke and Jiajie Yu and Zixiong Qin and Zhiguo Zhang and Wenzheng Chi and Wei Zhang},
journal= {arXiv preprint arXiv:2507.19742},
year = {2025}
}
备注
10 pages,9 figures