RadDiagSeg-M:用于联合诊断和多目标分割的放射科视觉语言模型
计算机视觉与模式识别
2025-10-22 v1 人工智能
摘要
当前大多数医学视觉语言模型在响应复杂视觉问题时难以同时生成诊断文本和像素级分割掩码。这代表了向临床应用迈出的主要限制,因为无法同时提供两种模态的辅助系统对医疗从业者的价值有限。为缓解这一限制,我们首先引入RadDiagSeg-D数据集,将异常检测、诊断和多目标分割统一且层次化地集成到一个任务中。RadDiagSeg-D覆盖多种影像模态,专为支持开发能够同时生成描述性文本和相应分割掩码的模型而设计。随后,我们利用该数据集提出一种新型视觉语言模型RadDiagSeg-M,能够实现联合异常检测、诊断和灵活的分割。RadDiagSeg-M提供高度信息丰富且临床实用的输出,有效满足了丰富辅助诊断上下文信息的需求。最后,我们对RadDiagSeg-M进行基准测试,展示其在多目标文本与掩码生成任务中的卓越性能,建立了一个稳健且具竞争力的基线。
引用
@article{arxiv.2510.18187,
title = {VelocityNet: Real-Time Crowd Anomaly Detection via Person-Specific Velocity Analysis},
author = {Fatima AlGhamdi and Omar Alharbi and Abdullah Aldwyish and Raied Aljadaany and Muhammad Kamran J Khan and Huda Alamri},
journal= {arXiv preprint arXiv:2510.18187},
year = {2025}
}
备注
8 pages, 3 figures