CLARIFY:用于理清模糊查询的对比偏好强化学习
机器学习
2025-06-11 v3
摘要
基于偏好的强化学习通过从人类偏好比较中推断奖励函数,绕过了显式的奖励工程,从而实现了与人类意图的更好对齐。然而,人类通常难以在相似片段之间标记明确的偏好,这降低了标签效率并限制了 PbRL 在真实世界中的适用性。为了解决这个问题,我们提出了一种离线 PbRL 方法:用于解决模糊反馈的对比学习(Contrastive LeArning for ResolvIng Ambiguous Feedback,CLARIFY),该方法学习一个包含偏好信息的轨迹嵌入空间,确保明确区分的片段彼此远离,从而促进选择更明确的查询。大量实验表明,CLARIFY 在非理想教师和真实人类反馈设置下均优于基线方法。我们的方法不仅选择了更具区分度的查询,还学习了有意义的轨迹嵌入。
引用
@article{arxiv.2506.00388,
title = {CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries},
author = {Ni Mu and Hao Hu and Xiao Hu and Yiqin Yang and Bo Xu and Qing-Shan Jia},
journal= {arXiv preprint arXiv:2506.00388},
year = {2025}
}
备注
ICML 2025