中文

通过词区域对齐改进胸部X光片与放射学报告的联合学习

机器学习 2021-09-07 v1 人工智能 计算与语言 计算机视觉与模式识别 图像与视频处理

摘要

自监督学习为探索临床常规中积累的无标注胸部X光片及其相关自由文本报告提供了无需人工监督的机会。本文提出一种联合图像文本表示学习网络(JoImTeRNet),用于在胸部X光图像及其放射学报告上进行预训练。该模型在全局图像-句子层面和局部图像区域-词层面均进行了预训练以实现视觉-文本匹配。两者均基于交叉熵和基于排序的三元组匹配损失(Triplet Matching Loss)进行双向约束。区域-词匹配使用注意力机制计算,无需关于其映射关系的直接监督。预训练的多模态表示学习为涉及图像和/或文本编码的下游任务铺平了道路。我们通过在 OpenI-IU 和 MIMIC-CXR 两个数据集上的跨模态检索和多标签分类展示了表示学习的质量。

关键词

引用

@article{arxiv.2109.01949,
  title  = {Improving Joint Learning of Chest X-Ray and Radiology Report by Word Region Alignment},
  author = {Zhanghexuan Ji and Mohammad Abuzar Shaikh and Dana Moukheiber and Sargur Srihari and Yifan Peng and Mingchen Gao},
  journal= {arXiv preprint arXiv:2109.01949},
  year   = {2021}
}

备注

10 Pages, 1 Figure, 3 Tables, Accepted in 12th Machine Learning in Medical Imaging (MLMI 2021) workshop