AstroRAG——面向天文问答的基于PageRank的检索增强生成管线
计算机视觉与模式识别
2026-05-26 v1
摘要
大型语言模型(LLMs)在自然语言处理中表现出强大能力,但仅依赖参数化知识时常生成事实错误。检索增强生成(RAG)通过以外部证据为响应 grounding,缓解了这些错误,但传统的检索-投放方法经常引入无关上下文,影响回答质量。本文提出AstroRAG——一个为天文问答设计的PageRank驱动的检索增强生成(RAG)管线。系统进行token感知的分块和按实例的临时索引于Elasticsearch中,然后执行两阶段检索:(i)采用最大边际相关性(MMR)获取小型且多样的候选集;(ii)采用reader驱动的PageRank(PR)对相似性图进行重排序,以在严格的token预算下识别紧凑且相互支持的上下文。我们的设计无需训练、具有隐私保护性和可复现性,因为每个实例都通过临时索引处理,以防止跨任务泄露。我们在AstroQA天文问答基准测试上评估了该管线,证明其在所有难度水平上均表现出竞争力。特别是,RAG增强的Mistral-7B实现了\textbf{79.49\%准确率}和\textbf{79.49\% F1得分},几乎翻倍了其非RAG版本的性能。这些结果凸显了纪律性检索和细化在提升特定领域推理方面的有效性,为将RAG扩展到其他科学领域奠定了稳健基础。
引用
@article{arxiv.2605.25039,
title = {AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy},
author = {Zhifeng Wang and Jason Jingshi Li and Kaihao Zhang and Ramesh Sankaranarayana},
journal= {arXiv preprint arXiv:2605.25039},
year = {2026}
}
备注
Accepted to IEEE CAI 2026