中文

通过无答案上下文的查询消歧:提升 Humanity's Last Exam 表现

计算与语言 2026-03-06 v1 人工智能

摘要

问题的表述是否严谨且无歧义对语言模型(LM)以及人的响应质量影响深远。尽管模型能力不断提升,但背景上下文与查询表述之间的相互作用仍未得到充分探索。本文研究了模型上下文窗口中背景 grounding 信息的质量如何影响准确率。我们发现,将基于良好 grounding 的动态上下文构建(即 RAG)与查询重写相结合,可有效消除查询歧义,从而实现显著的准确率提升。给定一个包含关联无答案 grounding 上下文的用户查询,通过消除查询歧义地重写问题,可在不改变答案本身的情况下实现基准测试的显著提升,甚至优于在查询前添加该上下文。使用 \texttt{gpt-oss-20b} 对 Humanity's Last Exam 的子集进行重写,提升 \texttt{gpt-5-mini} 的准确率从 0.14 提升至 0.37。我们展示了这种准确率提升无法仅通过推理时的提示词实现;相反,需要明确的重写与解答阶段。代码与数据已公开于 https://github.com/mmajurski/lm-rewrite-uplift。

关键词

引用

@article{arxiv.2603.04454,
  title  = {Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam},
  author = {Michael Majurski and Cynthia Matuszek},
  journal= {arXiv preprint arXiv:2603.04454},
  year   = {2026}
}