中文

面向检索增强生成的 SLO 条件动作路由:客观消融与失效模式

机器学习 2026-01-06 v1

摘要

检索增强生成(RAG)引入了一个实际的控制问题:必须为每个查询选择检索深度和生成行为,以满足成本、拒绝率和幻觉风险等服务水平目标(SLO)。本 work 将 per-query 控制建模为一个小型离散动作:选择检索深度和生成模式(受控 vs. 自动),或拒绝。构建了一个来自 SQuAD 2.0 的离线日志数据集,执行每个动作并记录准确率、token 成本、幻觉/拒绝指标以及 SLO 加权奖励。评估了两种简单的策略学习目标:监督分类 per-state 最佳动作(Argmax-CE)和奖励加权变体(Argmax-CE-WT)。在评估的设置下,强大的固定基准(低 k,受控提示)表现竦争;学习型策略主要在以质量为焦点的 SLO 下提供额外的成本节省,在以廉价 SLO 下当拒绝被大力奖励时可能出现拒绝崩溃。该 work 的贡献是 RAG 管道的 SLO-aware 控制的可复现案例研究,强调失效模式和报告惯例,而非提出新的检索器或语言模型。

关键词

引用

@article{arxiv.2601.00841,
  title  = {SLO-Conditioned Action Routing for Retrieval-Augmented Generation: Objective Ablation and Failure Modes},
  author = {Bharath Nunepalli},
  journal= {arXiv preprint arXiv:2601.00841},
  year   = {2026}
}