中文

来自人类反馈的多样性

机器学习 2025-06-10 v3 人工智能 神经与进化计算

摘要

多样性在诸多问题中扮演重要角色,例如集成学习、强化学习与组合优化。如何定义多样性度量是一个长期存在的问题。许多方法依赖专家经验来定义恰当的行为空间,进而获得多样性度量,然而这在许多场景下颇具挑战。本文提出从人类反馈中学习行为空间的问题,并给出一种称为来自人类反馈的多样性(Diversity from Human Feedback, DivHF)的通用方法予以解决。DivHF 通过查询人类反馈来学习与人类偏好一致的行为描述符。所学行为描述符可与任意距离度量结合以定义多样性度量。我们将 DivHF 与质量-多样性优化算法 MAP-Elites 结合,并在 QDax 套件上开展实验,证明了其有效性。结果表明,相较于无人类反馈的直接数据驱动方法所学行为,DivHF 所学行为与人类需求更为一致,并使最终解在人类偏好下更具多样性。我们的贡献包括形式化该问题、提出 DivHF 方法,以及通过实验证明其有效性。

关键词

引用

@article{arxiv.2310.06648,
  title  = {Diversity from Human Feedback},
  author = {Ren-Jian Wang and Ke Xue and Yutong Wang and Peng Yang and Haobo Fu and Qiang Fu and Chao Qian},
  journal= {arXiv preprint arXiv:2310.06648},
  year   = {2025}
}