中文

描述医学影像中的任意内容

计算机视觉与模式识别 2025-05-27 v2

摘要

局部图像描述已通过诸如Describe Anything Model(DAM)等模型取得了显著进展,该模型无需显式的区域-文本监督即可生成详细的特定区域描述。然而,此类能力尚未广泛应用于医学影像等专业领域,在这些领域中,诊断解读依赖于细微的局部发现而非全局理解。为弥合这一差距,我们提出了MedDAM,这是首个利用大型视觉-语言模型进行医学影像特定区域描述的综合性框架。MedDAM采用由医学专家设计的、针对特定成像模态的提示,并建立了一个稳健的评估基准,该基准包含定制的评估协议、数据预处理流水线和专门的问答模板库。该基准通过属性级验证任务评估MedDAM和其他可适配的大型视觉-语言模型,重点关注临床事实性,从而规避了医学数据集中缺乏真实区域-描述配对的问题。在VinDr-CXR、LIDC-IDRI和SkinCon数据集上的大量实验表明,MedDAM在该任务上优于领先的同类模型(包括GPT-4o、Claude 3.7 Sonnet、LLaMA-3.2 Vision、Qwen2.5-VL、GPT-4Rol和OMG-LLaVA),揭示了区域级语义对齐在医学图像理解中的重要性,并将MedDAM确立为临床视觉-语言整合的一个有前景的基础。

关键词

引用

@article{arxiv.2505.05804,
  title  = {Describe Anything in Medical Images},
  author = {Xi Xiao and Yunbei Zhang and Thanh-Huy Nguyen and Ba-Thinh Lam and Janet Wang and Lin Zhao and Jihun Hamm and Tianyang Wang and Xingjian Li and Xiao Wang and Hao Xu and Tianming Liu and Min Xu},
  journal= {arXiv preprint arXiv:2505.05804},
  year   = {2025}
}