中文

SATA-BENCH:面向多项选择题的“选择所有适用项”基准

计算与语言 2025-10-21 v3 人工智能

摘要

大型语言模型(LLM)越来越多地在单选多项选择任务上进行评估,然而许多现实世界问题需要从一组选项中识别出所有正确答案。这种能力仍未被充分研究。我们引入了 SATA-BENCH,这是首个用于评估 LLM 在跨多个领域(包括阅读理解、法律和生物医学)的“选择所有适用项”(SATA)问题上的专用基准。我们对 27 个开源和专有模型的评估揭示了一个显著差距:即使是最强的模型也仅达到 41.8% 的精确匹配,暴露了 LLM 无法可靠地识别所有正确答案。我们发现这一弱点源于两个核心挑战:选择偏差——模型不顾内容偏好某些选项;以及计数偏差——模型无法预测正确的答案数量。为解决这些问题,我们提出了 Choice Funnel,一种将 token 去偏差与自适应阈值相结合的解码策略,以引导模型做出完整且准确的选择。与竞争性基线相比,Choice Funnel 的精确匹配率提高了高达 29%,同时推理成本降低了 64% 以上。我们的发现揭示了当前 LLM 的根本局限性,并引入了一个用于诊断和改进多答案推理的新框架。我们发布 SATA-BENCH 和 Choice Funnel,以促进 LLM 在现实的多答案应用中稳健决策的发展。

关键词

引用

@article{arxiv.2506.00643,
  title  = {SATA-BENCH: Select All That Apply Benchmark for Multiple Choice Questions},
  author = {Weijie Xu and Shixian Cui and Xi Fang and Chi Xue and Stephanie Eckman and Chandan K. Reddy},
  journal= {arXiv preprint arXiv:2506.00643},
  year   = {2025}
}

备注

40 pages, 13 figures