中文

充分利用文本语义改进生物医学视觉-语言处理

计算机视觉与模式识别 2022-12-08 v4 计算与语言

摘要

生物医学领域存在大量多模态数据,例如放射影像与报告。大规模解读此类数据对于改善临床诊疗和加速临床研究至关重要。与一般领域相比,具有复杂语义的生物医学文本给视觉-语言建模带来了额外挑战,而以往工作所使用的模型对领域适应不足,缺乏特定领域的语言理解能力。本文表明,基于原则性的文本语义建模可以显著改进自监督视觉-语言处理中的对比学习。我们发布了一个语言模型,该模型通过改进的词表以及利用放射报告中的语义和语篇特征的新颖语言预训练目标,在放射自然语言推理任务上取得了最先进的结果。此外,我们提出了一种以更好文本建模为重点的自监督联合视觉-语言方法。该方法在一系列公开基准上确立了新的最先进水平,部分得益于我们所提出的领域特定语言模型。我们发布了一个由放射科医生标注的、具有局部对齐短语接地标注的新数据集,以促进生物医学视觉-语言处理中复杂语义建模的研究。包括在该新数据集上的广泛评估表明,尽管仅使用全局对齐目标,我们的对比学习方法在文本语义建模的辅助下,在分割任务上优于先前的方法。

关键词

引用

@article{arxiv.2204.09817,
  title  = {Making the Most of Text Semantics to Improve Biomedical Vision--Language Processing},
  author = {Benedikt Boecking and Naoto Usuyama and Shruthi Bannur and Daniel C. Castro and Anton Schwaighofer and Stephanie Hyland and Maria Wetscherek and Tristan Naumann and Aditya Nori and Javier Alvarez-Valle and Hoifung Poon and Ozan Oktay},
  journal= {arXiv preprint arXiv:2204.09817},
  year   = {2022}
}

备注

To appear in ECCV 2022. Code: https://aka.ms/biovil-code Dataset: https://aka.ms/ms-cxr Demo Notebook: https://aka.ms/biovil-demo-notebook