E2HiL:面向高效现实人类在回路中的强化学习的熵导向样本选择
机器人学
2026-01-29 v1 机器学习
摘要
人类在回路中的指导(HiL-RL)已成为有效方法,用于在复杂现实世界操作任务中实现更快的在线强化学习收敛。然而,现有的 HiL-RL 框架常常存在样本效率低的问题,需要大量的人类干预才能实现收敛,从而导致高昂的劳动力成本。为此,我们提出了一个样本效率高的现实世界人类在回路中的强化学习框架,命名为 \method,通过主动选择有信息量的样本来减少人类干预。具体而言,通过稳定的策略熵减少实现更好的探索与开发造作之间的权衡,从而提高样本效率。我们首先构建不同样本对策略熵影响的函数,这些函数通过策略动作概率与软优势的协方差来高效估计。然后我们选择具有适中影响函数值的样本,其中会导致熵快速下降的短路样本以及影响微小的噪声样本都被剔除。对四个现实世界操作任务进行的广泛实验表明,\method 在成功率上提高了 42.1%,而只需 10.1% 的人类干预,验证了其有效性。项目页面提供了代码、视频和数学公式,可在 https://e2hil.github.io/ 查找。
关键词
引用
@article{arxiv.2601.19969,
title = {E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning},
author = {Haoyuan Deng and Yuanjiang Xue and Haoyang Du and Boyang Zhou and Zhenyu Wu and Ziwei Wang},
journal= {arXiv preprint arXiv:2601.19969},
year = {2026}
}
备注
Project page: https://e2hil.github.io/