中文

关注文本:指令微调语言模型是比您想象中更鲁棒的多项选择选择器

计算与语言 2024-08-21 v2 人工智能

摘要

多项选择题 (MCQs) 通常被用于评估大型语言模型 (LLMs) 的能力。一种常见的评估模型响应的方法是根据第一个 token 预测的对数概率对候选答案进行排序。另一种方法是检查文本输出。先前的工作表明,首 token 概率对 MCQ 措辞的变化缺乏鲁棒性,并且对于指令微调模型,首 token 概率与文本答案不匹配。因此,在本文中,我们研究了文本答案的鲁棒性。我们表明,当首 token 答案与文本答案不匹配时,文本答案对问题扰动比首 token 概率更具鲁棒性。鲁棒性差异随着不匹配率的增大而增加。当不匹配率超过 50\% 时,相比于使用诸如 PriDe 等最先进去偏方法去偏后的首 token 概率,文本答案对选项顺序变化更具鲁棒性。我们的发现为进一步证明文本答案评估优于首 token 概率评估提供了证据。

关键词

引用

@article{arxiv.2404.08382,
  title  = {Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think},
  author = {Xinpeng Wang and Chengzhi Hu and Bolei Ma and Paul Röttger and Barbara Plank},
  journal= {arXiv preprint arXiv:2404.08382},
  year   = {2024}
}

备注

COLM 2024