中文

专长问题:从专业化反馈中学习

机器学习 2022-11-15 v1

摘要

基于人类反馈的强化学习(RLHF)是一种训练智能体执行难以明确指定任务的强大技术。然而,人类反馈可能存在噪声,尤其当人类教师缺乏相关知识或经验时。教师的专业水平参差不齐,且同一教师对任务的不同组成部分可能具备不同程度的专长。因此,从多位教师处学习的 RLHF 算法面临一个专长问题:给定反馈的可靠性既取决于其来源教师,也取决于该教师在与任务相关组成部分上的专长程度。现有的最先进 RLHF 算法假设所有评估来自同一分布,掩盖了这种人际与人内差异,使其无法考虑或利用专长上的变化。我们形式化了该问题,将其实现为现有 RLHF 基准的扩展,评估了一种最先进 RLHF 算法的性能,并探索了改进查询与教师选择的技术。我们的主要贡献是论证并刻画了专长问题,并提供了一个用于测试未来解决方案的开源实现。

关键词

引用

@article{arxiv.2211.06519,
  title  = {The Expertise Problem: Learning from Specialized Feedback},
  author = {Oliver Daniels-Koch and Rachel Freedman},
  journal= {arXiv preprint arXiv:2211.06519},
  year   = {2022}
}

备注

Accepted to the ML Safety Workshop, NeurIPS 2022