迈向基于多智能体协作的可靠胎儿超声解读
计算机视觉与模式识别
2026-05-26 v1 多智能体系统
摘要
自动化胎儿超声解读需要一个从视觉感知(包括平面识别和解剖分割)到临床理解(包括生物测量和诊断报告)的工作流程。然而,当前盛行的“一任务一模型”范式限制了跨此多步骤过程的系统性证据整合。尽管多模态大语言模型(MLLM)展现出有前景的视觉理解能力,但其有限的领域特定基础知识和幻觉风险限制了其在胎儿超声分析中的可靠性。为了解决这些局限性,我们提出了FetUSAgents,一个工具增强的多智能体系统,用于全面的胎儿超声解读,支持视觉问答(VQA)、报告生成、图像描述和视频摘要。FetUSAgents通过协作的LLM智能体协调特定任务的视觉工具,并将临床查询分解为从解剖识别到定量测量的子任务。我们进一步引入了双路径证据仲裁(DPEA),它将基于LLM的审慎推理与来自专门视觉工具的结构化计算证据相结合。一个检索增强的证据库整合了中间发现,以支持可追溯且具有临床依据的结论。此外,我们构建了FetUS-VQA,一个专门用于胎儿超声的VQA基准,包含1,892张图像和跨越10个临床任务的3,205个问答对。广泛的分布外实验表明,FetUSAgents优于通用和医学MLLM,在VQA准确率上超过最强基线25%以上。这些结果表明了一条通往用于产前成像的、基于证据的临床助手的可扩展路径。代码已公开。
引用
@article{arxiv.2605.25357,
title = {Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration},
author = {Xiaotian Hu and Mingxuan Liu and Junwei Huang and Kasidit Anmahapong and Yifei Chen and Yiming Huang and Xuguang Bai and Zihan Li and Hongjia Yang and Yingqi Hao and Hong Xu and Yu Jiang and Tian Tian and Yi Liao and Haibo Qu and Qiyuan Tian},
journal= {arXiv preprint arXiv:2605.25357},
year = {2026}
}