面向胎儿超声解读的认知感知视觉语言基础模型
计算机视觉与模式识别
2026-01-28 v3 人工智能
信息检索
多媒体
摘要
最近的医学视觉语言模型在 VQA、报告生成和异常检测等任务中显示出前景。然而,大多数模型针对结构化的成人影像进行适配,在胎儿超声领域表现不佳,因而面临多视角图像推理、众多疾病和图像多样性等挑战。为弥合这一差距,我们引入 FetalMind,这是一个专为胎儿超声设计的医学 AI 系统,支持报告生成和诊断。依据临床工作流程,我们提出显著认知解耦(Salient Epistemic Disentanglement, SED),通过注入专家精选的二分图来解耦视角-疾病关联,并通过强化学习引导沿临床忠实步骤进行偏好选择。该设计缓解了不同疾病间的变异性和不同视角间的异质性,减少学习瓶颈,同时使模型推理与产科实践保持一致。为大规模训练 FetalMind,我们 curate 了 FetalSigma-1M 数据集,这是首个大规模胎儿超声报告语料库,包含来自十二个医疗中心的 2 万份报告,解决了领域数据稀缺的问题。大量实验表明,FetalMind 在所有妊娠周数下均优于开源和闭源基线,平均提升 14%,对关键条件准确率提升 61.2%,同时保持高效、稳定和可扩展。项目页面: https://hexiao0275.github.io/FetalMind。
引用
@article{arxiv.2510.12953,
title = {Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation},
author = {Xiao He and Huangxuan Zhao and Guojia Wan and Wei Zhou and Yanxing Liu and Juhua Liu and Yongchao Xu and Yong Luo and Dacheng Tao and Bo Du},
journal= {arXiv preprint arXiv:2510.12953},
year = {2026}
}
备注
This paper contains fundamental errors and will not be replaced