跨时间线阅读:用于回答历时问题的RAG
计算与语言
2025-08-01 v1 人工智能
信息检索
摘要
虽然检索增强生成(RAG)在为大型语言模型(LLM)注入静态事实知识方面表现出色,但在处理需要跨时间跟踪实体和现象的纵向查询方面存在显著不足。这种缺陷源于传统基于语义的检索方法无法收集在指定时间段内既在主题上相关又在时间上连贯的证据。为此,我们提出了一种新框架,通过根本性地重构RAG管道以注入时间逻辑。我们的 methodology 开始将用户查询解构为其核心主题和时间窗口。随后,采用专用检索器,对语义匹配进行校准以增强时间相关性,确保收集的证据集合在整个查询期间保持连续性。为评估这一能力,我们引入了分析性历时问题答案基准(ADQAB),该基准基于真实与人工合成的财经新闻混合语料库构建。ADQAB上的实验结果表明,我们的方法在答案准确率上实现显著提升,相较于标准RAG实现方式提升13%至27%。本工作为RAG系统实现处理复杂问题所需的精细化、演化分析提供了验证路径。该研究的数据集和代码已公开发布于 https://github.com/kwunhang/TA-RAG。
引用
@article{arxiv.2507.22917,
title = {Reading Between the Timelines: RAG for Answering Diachronic Questions},
author = {Kwun Hang Lau and Ruiyuan Zhang and Weijie Shi and Xiaofang Zhou and Xiaojun Cheng},
journal= {arXiv preprint arXiv:2507.22917},
year = {2025}
}