RefuteBench:评估大规模语言模型的反驳指令遵循
计算与语言
2024-07-25 v4 人工智能
摘要
大规模语言模型的应用范围正在不断扩大。在实际使用中,用户可能根据模型的输出提供反馈,希望模型能够根据反馈完成相应的响应。模型是否能够恰当地应对用户的反驳反馈并在对话中持续遵循执行尚未得到彻底分析。基于此,本文提出了一个全面的基准测试,RefuteBench,涵盖问答、机器翻译和邮件写作等任务。评估旨在 Assess 模型是否能够积极接受以反驳形式提供的反馈,以及是否能够在对话中持续遵循用户需求。我们对众多大规模语言模型进行评估,发现大规模语言模型顽固,即倾向于其内部知识,常常无法遵从用户反馈。此外,随着对话长度的增加,模型逐渐忘记用户陈述的反馈并回退到自己的响应。我们进一步提出一种回忆与重复提示作为一种简单且有效的方法,以增强模型对反馈的响应能力。
引用
@article{arxiv.2402.13463,
title = {RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models},
author = {Jianhao Yan and Yun Luo and Yue Zhang},
journal= {arXiv preprint arXiv:2402.13463},
year = {2024}
}
备注
ACL 2024 final version