检测不等于解决:检索增强 LLM 中的监控-控制差距
人工智能
2026-05-27 v1
摘要
检索增强 LLM 被部署用于证据质量决定行动安全的任务,但评估协议假设单轮鲁棒性可预测证据在多轮累积时的鲁棒性。我们表明这一假设根本错误。模型表现出监控-控制差距:它们容易 acknowledge 矛盾证据,但这种意识未能约束其最终建议——识别认知冲突不等于安全地解决它。通过跨四个模型家族(1.5B-32B 参数)和 50,000 轮的多轮文档累积协议,我们展示了单轮诊断系统高估 RAG 安全性,矛盾 acknowledgment 与安全解决不相关,模式经有针对性的人类验证确认,且不存在通用提示修复方案。汇聚机制证据——隐藏状态探测、注意力分析和响应策略分类——指向行动选择为最可信的缺陷所在:危险相关信息在不安全生成期间被内部表示并获得增强注意力,但未能约束输出行为。在高风险场景中,检索增强系统必须测量并缩小模型识别与实际行动之间的差距才能被信任。
引用
@article{arxiv.2605.27157,
title = {Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs},
author = {Zhe Yu and Wenpeng Xing and Chen Ye and Xuyang Teng and Bo Yang and Changting Lin and Meng Han},
journal= {arXiv preprint arXiv:2605.27157},
year = {2026}
}