TREND:基于演示的鲁棒偏好强化学习的三教学框架
机器人学
2025-05-12 v1 计算机视觉与模式识别
摘要
由人类或VLM标注者收集的偏好反馈通常含有噪声,这对依赖于准确偏好标签的基于偏好的强化学习构成了重大挑战。为了应对这一挑战,我们提出了TREND,这是一个新颖的框架,它将少样本专家演示与三教学策略相结合,以有效缓解噪声。我们的方法同时训练三个奖励模型,每个模型将其小损失偏好对视为有用知识,并将这些有用对教给其同伴网络以更新参数。值得注意的是,我们的方法只需少至一到三个专家演示即可实现高性能。我们在各种机器人操作任务上评估了TREND,即使在噪声水平高达40%的情况下,成功率也达到了90%,突显了其在处理噪声偏好反馈方面的有效鲁棒性。项目页面:https://shuaiyihuang.github.io/publications/TREND。
引用
@article{arxiv.2505.06079,
title = {TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations},
author = {Shuaiyi Huang and Mara Levy and Anubhav Gupta and Daniel Ekpo and Ruijie Zheng and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2505.06079},
year = {2025}
}
备注
ICRA 2025