中文

面向信息论主动感知的连续控制策略学习

机器人学 2023-05-18 v2 机器学习

摘要

本文提出一种利用信息论代价学习用于主动地标定位与探索的连续控制策略的方法。我们考虑一个在有限感知范围内检测地标的移动机器人,并解决学习一种最大化地标状态与传感器观测之间互信息的控制策略的问题。我们采用卡尔曼滤波器将地标状态中的部分可观测问题转换为马尔可夫决策过程(MDP),采用可微分视场塑造奖励,并采用基于注意力的神经网络表示控制策略。该方法进一步与主动体积建图相统一,以在地标定位之外促进探索。性能在若干模拟地标定位任务中对比基准方法得以展示。

关键词

引用

@article{arxiv.2209.12427,
  title  = {Learning Continuous Control Policies for Information-Theoretic Active Perception},
  author = {Pengzhi Yang and Yuhan Liu and Shumon Koga and Arash Asgharivaskasi and Nikolay Atanasov},
  journal= {arXiv preprint arXiv:2209.12427},
  year   = {2023}
}

备注

7 pages, 6 figures, submitted to International Conference on Robotics and Automation (ICRA) 2023