FactGuard: 利用多智能体系统生成可回答和不可回答问题以增强长上下文LLM抽取
计算与语言
2025-04-09 v1 人工智能
摘要
抽取式阅读理解系统旨在在给定文本中定位问题的正确答案。然而,一个持续的挑战在于确保这些模型在回答问题时保持高准确率,同时可靠地识别不可回答的查询。尽管大语言模型(LLM)在阅读理解方面取得了显著进展,这一问题仍然至关重要,特别是随着所支持上下文长度的不断扩展。为应对这一挑战,我们提出了一种基于多智能体协作框架的创新数据增强方法。与传统方法(如SQuAD 2.0数据集所需的高成本人工标注过程)不同,我们的方法自主生成基于证据的问答对并系统构建不可回答问题。利用该方法,我们开发了FactGuard-Bench数据集,包含25,220个可回答和不可回答问题场景的样本,上下文长度从8K到128K。在七个流行LLM上进行的实验评估表明,即使最先进的模型也仅达到61.79%的整体准确率。此外,我们强调模型对不可回答问题进行推理的能力的重要性,以避免生成看似合理但错误的答案。通过在多智能体协作框架中实现高效的数据选择和生成,我们的方法显著降低了传统上与人工标注相关的高成本,并为LLM的训练和优化提供了有价值的见解。
引用
@article{arxiv.2504.05607,
title = {FactGuard: Leveraging Multi-Agent Systems to Generate Answerable and Unanswerable Questions for Enhanced Long-Context LLM Extraction},
author = {Qian-Wen Zhang and Fang Li and Jie Wang and Lingfeng Qiao and Yifei Yu and Di Yin and Xing Sun},
journal= {arXiv preprint arXiv:2504.05607},
year = {2025}
}