Route, Retrieve, Reflect, Repair: 面向医学影像中视觉检测与语言推理的自我完善代理框架
计算机视觉与模式识别
2026-03-10 v2
摘要
医学影像分析日益依赖大型视觉语言模型(VLM),但大多数系统仍是单次传递的黑盒,无法有效控制推理过程、安全性及空间定位。我们提出 R^4 框架,将医学影像工作流程分解为四个协调代理:Router 从图像、患者史和元数据中配置任务与专长感知的提示;Retriever 通过类比记忆和 pass@k 采样联合生成自由文本报告和边界框;Reflector 对每对草稿框进行批判,识别关键临床错误模式(否定、侧位、 unsupported claims、矛盾、缺失发现及定位错误);Repairer 在目标约束下迭代修订叙事与空间输出,同时精选高质量类比样本供后续使用。在胸片分析任务上实现多个现代 VLM 后端,评估报告生成和弱监督检测任务时,R^4 相较于强基线模型的 LLM-as-a-Judge 分数提升约 +1.7-+2.5 分,mAP50 提升 +2.5-+3.5 分绝对值,无需任何梯度微调。这些结果表明,代理路由、反思与修复可将强但脆弱的 VLM 转化为更可靠、更可靠定位的临床影像解释工具。我们的代码可在 https://github.com/faiyazabdullah/MultimodalMedAgent 查阅。
引用
@article{arxiv.2601.08192,
title = {Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging},
author = {Md. Faiyaz Abdullah Sayeedi and Rashedur Rahman and Siam Tahsin Bhuiyan and Sefatul Wasi and Ashraful Islam and Saadia Binte Alam and AKM Mahbubur Rahman},
journal= {arXiv preprint arXiv:2601.08192},
year = {2026}
}