中文

学习利用时间结构进行生物医学视觉-语言处理

计算机视觉与模式识别 2024-02-23 v2 计算与语言

摘要

视觉-语言处理中的自监督学习利用了影像与文本模态之间的语义对齐。先前的生物医学视觉-语言处理(VLP)工作主要依赖于单张图像与报告对的配对对齐,尽管临床记录通常参考先前的图像。这不仅导致模态间对齐不佳,也错失了通过数据中已有的时间内容来挖掘丰富自监督信号的机会。在本工作中,我们在训练和微调时(若可用)显式地考虑先前的图像与报告。我们的方法名为 BioViL-T,使用 CNN-Transformer 混合多图像编码器与文本模型联合训练。其设计可灵活应对诸如姿态变化和时间上输入图像缺失等浮现的挑战。所得模型在单图像与多图像设定下的下游任务中均表现出色,在(I)进展分类、(II)短语定位、(III)报告生成上取得了最先进的性能,同时在疾病分类和句子相似度任务上提供了一致的改进。我们发布了一个新颖的多模态时间基准数据集 MS-CXR-T,以从时间语义角度量化视觉-语言表征的质量。我们的实验结果表明了引入先前图像与报告以充分利用数据的优势。

关键词

引用

@article{arxiv.2301.04558,
  title  = {Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing},
  author = {Shruthi Bannur and Stephanie Hyland and Qianchu Liu and Fernando Pérez-García and Maximilian Ilse and Daniel C. Castro and Benedikt Boecking and Harshita Sharma and Kenza Bouzid and Anja Thieme and Anton Schwaighofer and Maria Wetscherek and Matthew P. Lungren and Aditya Nori and Javier Alvarez-Valle and Ozan Oktay},
  journal= {arXiv preprint arXiv:2301.04558},
  year   = {2024}
}

备注

To appear in CVPR 2023