中文

分块、检索与重排序:面向政策文档问答的 RAG 架构实证评估

计算与语言 2026-01-23 v1 人工智能 信息检索

摘要

将大语言模型 (LLM) 整合到公共卫生政策领域,为浏览由疾病控制与预防中心 (CDC) 等机构维护的海量监管指南库提供了一种变革性方法。然而,LLM 产生幻觉的倾向(即看似合理但事实上不正确的断言)构成了在这些信息完整性不容妥协的高风险环境中采用这些技术的关键障碍。本实证评估探讨了检索增强生成 (RAG) 架构在通过将生成输出锚定于权威文档上下文来缓解这些风险方面的有效性。具体而言,本研究比较了基线 Vanilla LLM 与采用交叉编码器重排序的 Basic RAG 和 Advanced RAG 流水线。实验框架采用 Mistral-7B-Instruct-v0.2 模型和 all-MiniLM-L6-v2 嵌入模型,处理由官方 CDC 政策分析框架与指南文档组成的语料库。该分析测量了两种不同的分块策略(基于递归字符和基于标记的语义切分)对系统准确性的影响,并通过一组精心挑选的复杂政策场景中的忠实度与相关性得分进行衡量。定量结果表明,虽然 Basic RAG 架构在忠实度上(0.621)相比 Vanilla 基线(0.347)有大幅提升,但 Advanced RAG 配置实现了 0.797 的更优忠实度平均值。这些结果表明,两阶段检索机制对于实现特定领域政策问答所需的精度至关重要,尽管文档分割中的结构约束仍是多步推理任务的重大瓶颈。

关键词

引用

@article{arxiv.2601.15457,
  title  = {Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering},
  author = {Anuj Maharjan and Umesh Yadav},
  journal= {arXiv preprint arXiv:2601.15457},
  year   = {2026}
}