中文

通过人类反馈实现质量多样性:迈向开放式多样性驱动优化

人工智能 2024-06-05 v3 神经与进化计算

摘要

基于人类反馈的强化学习(RLHF)在缺乏易定义性能度量的定性任务中展现了潜力。然而,当 RLHF 常用于优化平均人类偏好时存在缺陷,尤其在需要多样化模型响应的生成任务中。同时,质量多样性(QD)算法擅长识别多样且高质量的解决方案,但往往依赖手工设计的多样性度量。本文引入通过人类反馈的质量多样性(QDHF),一种从人类对解之间相似性的判断逐步推断多样性度量的新方法,从而增强 QD 算法在复杂与开放式领域的适用性与有效性。实证研究表明,QDHF 在自动多样性发现上显著优于最先进方法,并在机器人与强化学习的标准基准上匹配具有手工设计多样性度量的 QD 的功效。值得注意的是,在开放式生成任务中,QDHF 显著增强了来自扩散模型的文本到图像生成的多样性,并在用户研究中更受青睐。我们通过分析 QDHF 的可扩展性、鲁棒性及推导多样性度量的质量作结,强调其在开放式优化任务中的优势。代码与教程见 https://liding.info/qdhf。

关键词

引用

@article{arxiv.2310.12103,
  title  = {Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization},
  author = {Li Ding and Jenny Zhang and Jeff Clune and Lee Spector and Joel Lehman},
  journal= {arXiv preprint arXiv:2310.12103},
  year   = {2024}
}

备注

ICML 2024