中文

UCAgents:面向多智能体医疗决策的单向收敛视觉证据锚定框架

计算机视觉与模式识别 2025-12-03 v1 人工智能

摘要

视觉语言模型(VLM)在医疗诊断方面显示出巨大的潜力,但因推理脱离可验证的图像证据而受到质疑,这削弱了临床信任。最近的多智能体框架通过模拟多学科团队(MDT)辩论来缓解单一模型偏见,但开放式讨论会放大文本噪声和计算成本,同时未能将推理锚定在视觉证据上,这是医疗决策的基石。我们提出UCAgents,一个采用分层多智能体框架,通过结构化证据审计实现单向收敛。受临床工作流程启发,UCAgents禁止位置变更,限制智能体交互为针对性证据验证,从而抑制修辞偏移并放大视觉信号提取。在UCAgents中,引入一种单轮询问讨论,以揭示视觉-文本错位的潜在风险。该设计联合约束视觉模糊和文本噪声,形成我们通过信息论正式化的双噪声瓶颈。在四个医疗VQA基准测试的广泛实验中,UCAgents实现了卓越的准确率(PathVQA上达71.3%,超越最前沿方法6.0%),且token成本降低87.7%,评估结果进一步证明UCAgents在发现更多视觉证据与避免混淆文本干扰之间取得了良好平衡。这些结果表明,UCAgents在临床实际部署中具备诊断可靠性和计算效率。代码已公开https://github.com/fqhank/UCAgents

关键词

引用

@article{arxiv.2512.02485,
  title  = {UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making},
  author = {Qianhan Feng and Zhongzhen Huang and Yakun Zhu and Xiaofan Zhang and Qi Dou},
  journal= {arXiv preprint arXiv:2512.02485},
  year   = {2025}
}