主动感知行为的现实世界强化学习
机器人学
2025-12-02 v1 人工智能
机器学习
摘要
机器人瞬时感官观察并不总是揭示任务相关的状态信息。在这种部分可观测性下,最优行为通常涉及主动行动以获取缺失信息。今天的标准机器人学习技术难以产生此类主动感知行为。我们提出一种简单实用的机器人学习配方,以高效训练主动感知策略。我们的做法是 asymmetric advantage weighted regression(AAWR),利用训练时的“特权”额外传感器。特权传感器使我们能够训练高质量的特权价值函数,以辅助估计目标策略的优势。以少量可能次优演示和一种易于获得的粗略策略初始化为启动,AAWR 能够快速获取主动感知行为并提升任务性能。在对 8 个操纵任务在 3 个机器人上进行的评估中,AAWR 生成了可靠的主动感知行为,显著优于所有先前方法。当用一个在主动感知任务上困难的“通用”机器人策略初始化时,AAWR 能够高效生成信息获取行为,使其在严重的部分可观测性下能够进行操纵任务。网站:https://penn-pal-lab.github.io/aawr/
引用
@article{arxiv.2512.01188,
title = {Real-World Reinforcement Learning of Active Perception Behaviors},
author = {Edward S. Hu and Jie Wang and Xingfang Yuan and Fiona Luo and Muyao Li and Gaspard Lambrechts and Oleh Rybkin and Dinesh Jayaraman},
journal= {arXiv preprint arXiv:2512.01188},
year = {2025}
}
备注
NeurIPS 2025 camera ready