面向人类在回环强化学习的选择性进度感知查询
机器人学
2025-09-26 v1
摘要
人类反馈可以极大加速机器人学习,但在实际场景中,这种反馈成本高昂且有限。现有的在回环强化学习方法常假设反馈丰富,限制了其在实际机器人部署中的实用性。本文我们引入 SPARQ,这是一种基于进度的查询策略,当学习停滞或恶化时才请求反馈,从而减少不必要的查询。我们在 PyBullet 中的模拟 UR5 方块拾取任务上评估了 SPARQ,与三个基线进行比较:无反馈、随机查询和始终查询。我们的实验表明,SPARQ 实现了接近完美的任务成功率,在反馈预算约为半数的情况下匹配始终查询的性能。它还比随机查询提供更稳定更高效的学习,显著优于无反馈训练。这些发现表明,选择性的、基于进度的查询策略可以使在回环强化学习中实现机器人的效率和可扩展性。
引用
@article{arxiv.2509.20541,
title = {Selective Progress-Aware Querying for Human-in-the-Loop Reinforcement Learning},
author = {Anujith Muraleedharan and Anamika J H},
journal= {arXiv preprint arXiv:2509.20541},
year = {2025}
}
备注
Preprint. 8 pages, 3 figures, 1 table, 1 algorithm. CoRL 2025 style (preprint). Code/data to be released