基于连续SE(3)轨迹的主动目标跟踪策略学习
机器人学
2023-05-18 v2 机器学习
摘要
本文提出一种新颖的基于模型的策略梯度算法,用于装备有限视场机载传感器的移动机器人跟踪动态目标。该任务是为移动机器人获取连续控制策略,以收集传感器测量值从而降低目标状态的不确定性,该不确定性由目标分布熵度量。我们设计了一种神经网络控制策略,以机器人位姿以及联合目标分布的均值向量与信息矩阵作为输入,并采用注意力层处理可变数量的目标。我们还显式推导了目标熵关于网络参数的梯度,从而实现高效的基于模型的策略梯度优化。
引用
@article{arxiv.2212.01498,
title = {Policy Learning for Active Target Tracking over Continuous SE(3) Trajectories},
author = {Pengzhi Yang and Shumon Koga and Arash Asgharivaskasi and Nikolay Atanasov},
journal= {arXiv preprint arXiv:2212.01498},
year = {2023}
}
备注
12 pages, 2 figures, submitted to Learning for Dynamics and Control Conference