中文

元数据、结构还是策略?RAG 上下文增强的分解

信息检索 2026-06-28 v1

摘要

检索增强生成(RAG)系统越来越多地通过附加质量元数据、将其结构化为显式记录以及采用跨步骤累积证据的多跳检索策略来增强检索到的段落。这些变化假设更丰富的上下文会产生更好的答案,然而现有的评估无法检验这一点,因为它们同时改变了所有三个因素。我们在六个基准、来自三个系列的四个模型和五个增强级别的受控实验中隔离了每个因素,总共评估了超过 24,000 个响应。这个假设不成立。大多数增强会降低准确率。被提示使用置信度分数的模型正确遵守了指令,但产生了更差的答案,这是利用率和准确率之间的差距,之前没有工作测量过。决定答案质量的因素不是上下文携带多少元数据,而是模型是否可以为给定任务对其采取行动。当元数据和检索策略与模型能力对齐时,较小的模型比前沿模型高出 19 个 F1 点。这些发现促成了一个可处理性层级,该层级仅从预训练属性就能预测模型可以有效地使用哪些元数据,将 RAG 设计重新定义为模型-上下文对齐问题,而不是元数据积累问题。

关键词

引用

@article{arxiv.2606.29645,
  title  = {Metadata, Structure, or Strategy? A Decomposition of RAG Context Enrichment},
  author = {Saber Zerhoudi and Michael Granitzer and Jelena Mitrovic},
  journal= {arXiv preprint arXiv:2606.29645},
  year   = {2026}
}