A$^2$Search:基于强化学习的模糊感知问答
计算与语言
2025-10-10 v1 人工智能
摘要
大型语言模型(LLM)和强化学习(RL)的最新进展导致了开放域问答(QA)中的卓越性能。然而,现有模型仍在处理接受多个有效答案的问题方面存在挑战。标准 QA 基准通常假设单个金标准答案,从而忽略了这一现实,产生不合适的训练信号。处理模糊性的现有方法通常依赖于高成本的手动标注,这在处理像 HotpotQA 和 MuSiQue 这样的多跳数据集时难以扩展。本文提出了 ASearch,一个无需标注的、端到端的训练框架,用于识别和处理模糊性。其核心是一个自动化管道,可检测模糊问题并通过轨迹抽样和证据验证来收集备用答案。然后,该模型使用精心设计的 奖励进行 RL 优化,这种奖励自然地容纳了多个答案。在八个开放域 QA 基准上的实验表明,ASearch 实现了新的状态-of-the-art 性能。仅凭一次抽样,ASearch-7B 在四个多跳基准上的平均 分数为 ,超过了所有强大的基线,包括规模更大的 ReSearch-32B()。广泛的分析进一步表明,ASearch 解决了模糊性并在基准之间实现了泛化,凸显了拥抱模糊性对于构建更可靠的 QA 系统至关重要。我们的代码、数据和模型权重可在 https://github.com/zfj1998/A2Search 查找。
引用
@article{arxiv.2510.07958,
title = {A$^2$Search: Ambiguity-Aware Question Answering with Reinforcement Learning},
author = {Fengji Zhang and Xinyao Niu and Chengyang Ying and Guancheng Lin and Zhongkai Hao and Zhou Fan and Chengen Huang and Jacky Keung and Bei Chen and Junyang Lin},
journal= {arXiv preprint arXiv:2510.07958},
year = {2025}
}