中文

一个字符可以决定你LLM评估的成败

计算与语言 2025-10-08 v1 人工智能

摘要

常见的大语言模型(LLM)评估依赖于示例来引导模型生成符合所需风格的响应。虽然已研究并标准化了所用示例的数量,但示例格式的选择方式影响较小。在评估协议和实际应用中,用户面临如何分隔上下文示例的选择:使用逗号?换行?分号?井号?等等?令人惊讶的是,我们发现这看似微小的选择会显著性地改变模型响应质量。例如,领先模型家族(Llama、Qwen、Gemma)在MMLU上的性能,因分隔符选择而相差约±23%。事实上,仅通过修改分隔示例的单个字符,即可将任何模型置于领先位置。我们通过探索注意力得分,发现表现良好的分隔符引导注意力指向输入中的关键标记。最后,我们探索了提高LLM对分隔符选择鲁健性的方法。我们发现,在提示中指定所选分隔符可提升鲁健性,并为选择最佳-performing分隔符提供了实用建议。

关键词

引用

@article{arxiv.2510.05152,
  title  = {A Single Character can Make or Break Your LLM Evals},
  author = {Jingtong Su and Jianyu Zhang and Karen Ullrich and Léon Bottou and Mark Ibrahim},
  journal= {arXiv preprint arXiv:2510.05152},
  year   = {2025}
}