中文

ComTraQ-MPC:面向有限主动定位更新下轨迹跟踪的元训练 DQN-MPC 集成方法

机器人学 2024-08-22 v3 人工智能 系统与控制 系统与控制

摘要

在部分可观测、随机环境中,主动定位更新(即智能体从传感器获取其真实状态信息的过程)次数受限时的轨迹跟踪最优决策,是一个重大挑战。传统方法通常难以在资源节约、准确的状态估计和精确跟踪之间取得平衡,导致次优性能。该问题在动作空间较大的环境中尤为突出,此时频繁且准确的状态数据需求至关重要,但主动定位更新的能力却受到外部限制的约束。本文提出了 ComTraQ-MPC,一种结合深度 Q 网络(DQN)与模型预测控制(MPC)的新框架,旨在主动定位更新受限的情况下优化轨迹跟踪。元训练的 DQN 确保自适应的主动定位调度,而 MPC 则利用可用的状态信息来改善跟踪。本工作的核心贡献在于两者的交互作用:DQN 的更新决策为 MPC 的控制策略提供信息,而 MPC 的结果反过来优化 DQN 的学习,从而构建出一个紧密协作的自适应系统。在仿真和真实环境中的实证评估表明,ComTraQ-MPC 显著提升了运行效率与精度,为复杂部分可观测环境中的轨迹跟踪提供了一种可泛化且近似最优的解决方案。

关键词

引用

@article{arxiv.2403.01564,
  title  = {ComTraQ-MPC: Meta-Trained DQN-MPC Integration for Trajectory Tracking with Limited Active Localization Updates},
  author = {Gokul Puthumanaillam and Manav Vora and Melkior Ornik},
  journal= {arXiv preprint arXiv:2403.01564},
  year   = {2024}
}

备注

* Equal contribution