中文

SilVar-Med:一种用于医学影像可解释异常检测的语音驱动视觉语言模型

计算机视觉与模式识别 2025-04-16 v1

摘要

医学视觉语言模型在各种医疗保健应用中展现出了巨大潜力,包括医学图像描述生成和诊断辅助。然而,现有大多数模型依赖于基于文本的指令,限制了它们在真实临床环境中的可用性,特别是在手术等场景中,基于文本的交互对医生而言通常是不切实际的。此外,当前的医学图像分析模型通常缺乏对其预测背后全面推理,这降低了它们在临床决策中的可靠性。鉴于医疗诊断错误可能会产生改变一生的后果,因此对可解释且理性的医疗辅助存在关键需求。为了应对这些挑战,我们引入了一种端到端语音驱动的医学 VLM——SilVar-Med,这是一种将语音交互与 VLMs 相结合的多模态医学图像助手,开创了用于医学图像分析的语音通信任务。此外,借助所提出的推理数据集,我们专注于对医学异常各项预测背后的推理进行解释。通过广泛的实验,我们展示了一项结合端到端语音交互、推理驱动的医学图像解释的概念验证研究。我们相信这项工作将通过促进更透明、更具交互性且在临床上可行的诊断支持系统,推动医疗 AI 领域的发展。我们的代码和数据集已在 SiVar-Med 上公开提供。

关键词

引用

@article{arxiv.2504.10642,
  title  = {SilVar-Med: A Speech-Driven Visual Language Model for Explainable Abnormality Detection in Medical Imaging},
  author = {Tan-Hanh Pham and Chris Ngo and Trong-Duong Bui and Minh Luu Quang and Tan-Huong Pham and Truong-Son Hy},
  journal= {arXiv preprint arXiv:2504.10642},
  year   = {2025}
}

备注

CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed