CHARM:考虑人类属性的强化建模
机器人学
2025-12-30 v2 人机交互
摘要
来自人类反馈的强化学习(RLHF)近期在多个领域取得了显著成功,其性能与反馈质量密切相关。虽然先前大量工作承认人类教师的特征会影响人类反馈模式,但很少有工作深入探究其实际影响。在本研究中,我们设计了一项探索性研究,调查人类反馈模式如何与人类特征相关联。我们在一项公共空间研究中进行了两个长时序任务,共有 46 名参与者参与。我们发现反馈模式不仅与任务统计量(如奖励)相关,还与参与者的特征相关,尤其是机器人经验和教育背景。此外,我们证明相较于仅使用任务统计量,利用人类特征可以更准确地预测人类反馈价值。我们收集的所有人类反馈与特征数据,以及我们的数据收集代码和用于预测更准确人类反馈的代码,均可在 https://github.com/AABL-Lab/CHARM 获取。
引用
@article{arxiv.2506.13079,
title = {CHARM: Considering Human Attributes for Reinforcement Modeling},
author = {Qidi Fang and Hang Yu and Shijie Fang and Jindan Huang and Qiuyu Chen and Reuben M. Aronson and Elaine S. Short},
journal= {arXiv preprint arXiv:2506.13079},
year = {2025}
}