ROZA 图:通过证据中心反馈实现自我提升的近确定性RAG
摘要
语言模型智能体在每次查询时都从零开始推理,忽略其链式思考过程。结果是准确率较低且每次运行差异较大。我们引入推理图,通过结构化边持久化每个证据的链式思考。与先前通过查询相似度检索提炼策略的记忆不同,推理图实现证据中心反馈:对于每个候选项,系统遍历所有潜在的评估边,以揭示该特定项在以往运行中的判定情况。我们进一步引入检索图,为一个计划器提供持续筛选一致被拒绝候选人的能力。两者共同构成ROZA图:一个自我提升的反馈回路,其中准确率提升随金标准通过率(推理图)而规模化,效率提升随候选池重叠度(检索图)而规模化。基础模型保持冻结,所有收益均来自通过图遍历的上下文工程。我们在MuSiQue和HotpotQA上进行评估,并包含一个高重复使用的部署子集。四项发现尤为突出。(1)剂量-反应:准确率随证据轮廓覆盖率单调提升,在相同问题上以50%以上覆盖率实现+10.6pp提升(47%错误减少,;每题Spearman ,,)。(2)多跳扩展:4跳准确率提升+11.0pp()。(3)跨簇预测:簇级提升由金标准通过率密度预测(,,个簇)。(4)高重复Pareto优势:在最高或与最高持平的准确率同时,成本降低46%,延迟降低46%。在固定20条候选语境内,针对重复运行的每条通过决策一致性(个配对探针,次每次运行,两个模型家族,三个温度)提升+8至+13pp;当检索图也进行筛选时提升+12至+21pp(所有)。
引用
@article{arxiv.2604.07595,
title = {ROZA Graphs: Self-Improving Near-Deterministic RAG through Evidence-Centric Feedback},
author = {Matthew Penaroza},
journal= {arXiv preprint arXiv:2604.07595},
year = {2026}
}
备注
31 pages including appendix, 12 figures, 15 tables, 3 algorithms; evaluation on MuSiQue, HotpotQA, and 2WikiMultiHopQA with Claude Sonnet 4, Haiku 4.5, and GPT-5-mini