ProtoMedAgent:基于隐私感知智能体工作流的多模态临床可解释性
计算机视觉与模式识别
2026-05-29 v2 人工智能
机器学习
多智能体系统
摘要
尽管可解释的原型网络为临床诊断提供了引人注目的基于案例的推理,但其原始连续输出缺乏医学文档所需的语义结构。通过标准检索增强生成(RAG)来弥合这一差距通常会引发“检索谄媚”,即大型语言模型(LLM)会产生事后合理化幻觉以迎合视觉预测。我们引入了 ProtoMedAgent,这是一个将多模态临床报告形式化为在严格神经符号瓶颈上的迭代零梯度测试时优化问题的框架。在冻结的原型骨干网络上运行时,我们将潜在的视觉和表格特征提炼为离散语义记忆。在线生成受到精确的集合论微分和反射式 Scribe-Critic 循环的严格约束,从数学上排除了不受支持的叙述性声明。为了安全地限制数据披露,我们引入了由 -匿名性和 -多样性控制的语义隐私门。在一个 4,160 名患者的临床队列上进行评估,ProtoMedAgent 达到了 91.2% 的比较集保真度,从根本上优于标准 RAG(46.2%)。此外,ProtoMedAgent 利用绑定的 -多样性相变,将构件级成员推理风险系统性降低了 9.8% 的绝对值。
引用
@article{arxiv.2605.14113,
title = {ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows},
author = {Alvaro Lopez Pellicer and Plamen Angelov and Marwan Bukhari and Yi Li and Eduardo Soares and Jemma Kerns},
journal= {arXiv preprint arXiv:2605.14113},
year = {2026}
}
备注
CVR 2026