“我的答案是C”:指令微调语言模型中首个词元概率与文本答案不匹配
计算与语言
2024-07-08 v2
摘要
语言生成的开放性使得自回归大语言模型(LLMs)的评估具有挑战性。一种常见的评估方法使用多项选择题(MCQ)来限制回答空间。然后通过排序候选答案的首个词元预测的对数概率来评估模型。然而,由于模型多样化的回答风格(例如以“Sure”开头或拒绝回答),首个词元可能无法一致地反映最终输出。因此,MCQ评估并不能反映模型与用户交互时的行为。但差异有多大呢?我们从多个维度评估了首个词元评估与文本输出的一致性,包括最终选项选择、拒绝率、选择分布以及在提示扰动下的鲁棒性。我们的结果表明,这两种方法在所有维度上严重不一致,不匹配率超过60%。在对话或安全数据上经过大量微调的模型尤其受到影响。关键的是,即使我们不断增加对提示的约束(即强制模型以选项字母或示例模板开头),模型仍然不一致。我们的发现i)强调了检查文本输出的重要性,并且ii)提醒不要仅依赖首个词元评估。
引用
@article{arxiv.2402.14499,
title = {"My Answer is C": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models},
author = {Xinpeng Wang and Bolei Ma and Chengzhi Hu and Leon Weber-Genzel and Paul Röttger and Frauke Kreuter and Dirk Hovy and Barbara Plank},
journal= {arXiv preprint arXiv:2402.14499},
year = {2024}
}
备注
ACL 2024 Findings