通过 AI 反馈实现质量-多样性
计算与语言
2023-12-11 v4 人工智能
机器学习
神经与进化计算
摘要
在许多文本生成问题中,用户可能不仅偏好单一回复,而是偏好一组可从中选择的高质量多样化输出。质量-多样性(QD)搜索算法以此类结果为目标,通过持续改进并多样化候选群体。然而,QD 对创意写作等定性领域的适用性,一直受限于算法化指定质量与多样性度量的困难。有趣的是,语言模型(LMs)近期的发展已能通过 AI 反馈引导搜索,即以自然语言提示 LM 评估文本的定性方面。利用这一进展,我们引入 Quality-Diversity through AI Feedback(QDAIF,通过 AI 反馈实现质量-多样性),其中进化算法应用 LM 既生成变异又评估候选文本的质量与多样性。在创意写作领域评估时,QDAIF 比非 QD 对照组以高质量样本覆盖了更多指定搜索空间。此外,对 QDAIF 生成的创意文本的人工评估验证了 AI 与人工评估间具有合理一致性。因此,我们的结果凸显了 AI 反馈引导面向创意与原创方案的开放式搜索的潜力,提供了一种看似可泛化至许多领域与模态的方法。以此方式,QDAIF 是迈向能够独立搜索、多样化、评估与改进的 AI 系统的一步,这些是人类社会创新能力核心技能中的一部分。
引用
@article{arxiv.2310.13032,
title = {Quality-Diversity through AI Feedback},
author = {Herbie Bradley and Andrew Dai and Hannah Teufel and Jenny Zhang and Koen Oostermeijer and Marco Bellagente and Jeff Clune and Kenneth Stanley and Grégory Schott and Joel Lehman},
journal= {arXiv preprint arXiv:2310.13032},
year = {2023}
}
备注
minor additions to supplementary results