中文

RadDiagSeg-M:面向放射学的联合诊断与多目标分割视觉语言模型

计算机视觉与模式识别 2025-10-22 v1 人工智能

摘要

当前大多数医学视觉语言模型在响应复杂视觉问题时难以联合生成诊断文本和像素级分割掩码。这代表了一个主要限制,因对于临床应用而言,无法同时提供两种模态的辅助系统对医务人员的帮助价值有限。为缓解这一限制,我们首先引入RadDiagSeg-D数据集,将异常检测、诊断和多目标分割统一且层次化地整合到一个任务中。RadDiagSeg-D覆盖多种影像模态,旨在支持开发能够同时生成描述性文本和相应分割掩码的模型。随后,我们利用该数据集提出一种新型视觉语言模型RadDiagSeg-M,具备联合异常检测、诊断和灵活分割能力。RadDiagSeg-M提供高度信息丰富且临床实用的结果,有效满足了为辅助诊断丰富上下文信息的需求。最后,我们对RadDiagSeg-M进行基准测试,展示其在多目标文本与掩码生成任务中的卓越性能,建立了稳健且具竞争力的基线。

关键词

引用

@article{arxiv.2510.18188,
  title  = {RadDiagSeg-M: A Vision Language Model for Joint Diagnosis and Multi-Target Segmentation in Radiology},
  author = {Chengrun Li and Corentin Royer and Haozhe Luo and Bastian Wittmann and Xia Li and Ibrahim Hamamci and Sezgin Er and Anjany Sekuboyina and Bjoern Menze},
  journal= {arXiv preprint arXiv:2510.18188},
  year   = {2025}
}