ELVIS:利用模态内相似性增强视觉语言预训练的局部性
计算机视觉与模式识别
2023-07-25 v2 计算与语言
摘要
深度学习在辅助放射科医生阅读胸部 X 光(CXR)图像方面显示出巨大潜力,但其为提升性能而对昂贵标注的需求阻碍了广泛的临床应用。视觉语言预训练(VLP)可通过利用放射照片常规生成的报告(大量存在且以图像-文本对的形式配对)来减轻标注负担与成本。此外,为应对 CXR 中计算机辅助诊断(CAD)对异常准确定位的需求,人们正提出面向定位感知的 VLP 扩展。然而,我们发现现有局部感知 VLP 文献所提出的公式实际上导致了下游定位任务所需的空间关系的丢失。因此,我们提出了利用模态内相似性增强 VLP 局部性的 ELVIS,一种感知模态内局部性的 VLP,以更好地保留放射照片或报告内部的局部性,从而增强理解文本报告中位置指代的能力。我们的局部感知 VLP 方法在多个分割任务和 MS-CXR 短语定位任务中显著优于最先进的基线。定性地,我们展示了与先前方法相比,ELVIS 能很好地聚焦于报告文本所描述的感兴趣区域,从而增强了可解释性。
引用
@article{arxiv.2304.05303,
title = {ELVIS: Empowering Locality of Vision Language Pre-training with Intra-modal Similarity},
author = {Sumin Seo and JaeWoong Shin and Jaewoo Kang and Tae Soo Kim and Thijs Kooi},
journal= {arXiv preprint arXiv:2304.05303},
year = {2023}
}
备注
Under review