中文

跨越鸿沟:多选题答案中分词化的深入探讨

计算与语言 2025-09-19 v1

摘要

在评估大型语言模型 (LLM) 的多选题 (MCQA) 时,通常在提示末尾添加 "Answer:" 以便通过下一个 token 的概率进行自动答案提取。然而,关于冒号后空格的分词方式尚无共识,此问题常被忽视。本文发现,这种看似无关紧要的分词差异可能导致最高达 11% 的准确率差异,并引发模型排名的重新排列,质疑了 prior work 中 LLM 比较的可靠性。令人惊讶的是,我们能够推荐一种特定策略——将空格与答案字母一起分词——因为我们观察到该策略能实现持续且具有统计显著性的性能提升。此外,该策略还能改善模型的校准效果,增强模型置信度估计的可靠性。我们的发现凸显了谨慎评估设计的重要性,强调了为确保可靠且可比结果需制定标准化、透明的评估协议的必要性。

关键词

引用

@article{arxiv.2509.15020,
  title  = {Mind the Gap: A Closer Look at Tokenization for Multiple-Choice Question Answering with LLMs},
  author = {Mario Sanz-Guerrero and Minh Duc Bui and Katharina von der Wense},
  journal= {arXiv preprint arXiv:2509.15020},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main