SealQA:提升搜索增强语言模型的推理标准
计算与语言
2026-04-10 v4 人工智能
机器学习
摘要
我们引入了 SealQA,这是一个新的挑战性基准测试,用于在网络搜索产生冲突、含噪或无用结果的事实查找问题上评估搜索增强语言模型。SealQA 有三种形式:(1)Seal-0(主要)和(2)Seal-Hard,用于评估事实准确性和推理能力,其中 Seal-0 侧重于聊天模型(例如 GPT-4.1)通常准确率接近于零的最具挑战性的问题;(3)LongSeal,将 SealQA 扩展为在“大海捞针”设置下测试长上下文、多文档推理。我们的评估揭示了当前模型的关键局限性:即使是前沿 LLM 在所有 SealQA 形式上的表现也很差。在 Seal-0 上,配备了工具的前沿智能体模型(如 o3 和 o4-mini)在其最佳推理努力下也仅分别达到 17.1% 和 6.3% 的准确率。我们发现,DeepSeek-R1-671B 和 o3-mini 等先进推理模型极易受到含噪搜索结果的影响。值得注意的是,增加测试时计算量并未在 o3-mini、o4-mini 和 o3 上带来可靠的增益,其性能往往早早达到平台期甚至下降。此外,虽然最近的模型较少受到“中间迷失”问题的影响,但在 LongSeal 中面对大量干扰项时,它们仍然无法可靠地识别相关文档。为了促进未来的研究,我们在 huggingface.co/datasets/vtllms/sealqa 上发布了 SealQA。
引用
@article{arxiv.2506.01062,
title = {SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models},
author = {Thinh Pham and Nguyen Nguyen and Pratibha Zunjare and Weiyuan Chen and Yu-Min Tseng and Tu Vu},
journal= {arXiv preprint arXiv:2506.01062},
year = {2026}
}
备注
Camera Ready version for ICLR 2026