RLVF:学习语言反馈而不发生过泛化
机器学习
2024-02-19 v1 人工智能
计算与语言
摘要
大型语言模型(LLMs)部署环境的多样性要求能够修改或定制默认模型行为,以纳入细微的需求和偏好。指定此类模型调整的一个便捷接口是高层语言反馈,例如“给老板起草邮件时不要使用表情符号”。然而,虽然编写高层反馈比为人类反馈强化学习(RLHF)收集标注简单得多,但我们发现,仅用此类反馈提示模型会导致将反馈过泛化到不相关的上下文中。我们研究了在不发生过泛化的情况下整合语言反馈的问题,并提出了一种新方法:带有约束偏好优化的情境化批评(Contextualized Critiques with Constrained Preference Optimization, C3PO)。C3PO 利用一段高层反馈生成一个小型合成偏好数据集,规定应如何(以及不应如何)应用该反馈。随后,它在根据合成偏好数据微调模型的同时,最小化在不适用该反馈的提示上与原始模型的散度。实验结果表明,我们的方法能有效地将语言反馈应用于相关场景,同时保留其他上下文中的现有行为。对于人类和 GPT-4 生成的高层反馈,C3PO 在有效遵循给定反馈方面与上下文基线相当,同时将过泛化减少了 30%。
引用
@article{arxiv.2402.10893,
title = {RLVF: Learning from Verbal Feedback without Overgeneralization},
author = {Moritz Stephan and Alexander Khazatsky and Eric Mitchell and Annie S Chen and Sheryl Hsu and Archit Sharma and Chelsea Finn},
journal= {arXiv preprint arXiv:2402.10893},
year = {2024}
}
备注
9 pages, 9 figures