BERTHop:一种用于胸部X光疾病诊断的有效视觉-语言模型
计算机视觉与模式识别
2021-08-12 v1 人工智能
计算与语言
摘要
视觉-语言(V&L)模型以图像和文本为输入,学习捕捉二者之间的关联。先前研究表明,预训练的V&L模型能显著提升下游任务(如视觉问答(VQA))的模型性能。然而,由于领域鸿沟,V&L模型应用于医学领域(例如X光图像与临床笔记)时效果较差。本文研究了将预训练V&L模型应用于医学应用所面临的挑战。具体而言,我们指出通用V&L模型中的视觉表征不适用于处理医学数据。为克服该局限,我们提出BERTHop,一种基于PixelHop++和VisualBERT的Transformer模型,以更好地捕捉两种模态间的关联。在常用胸部疾病诊断基准OpenI数据集上的实验表明,BERTHop取得了98.12%的平均曲线下面积(AUC),比最先进(SOTA)方法高1.62%,而其训练数据量仅为其九分之一。
引用
@article{arxiv.2108.04938,
title = {BERTHop: An Effective Vision-and-Language Model for Chest X-ray Disease Diagnosis},
author = {Masoud Monajatipoor and Mozhdeh Rouhsedaghat and Liunian Harold Li and Aichi Chien and C. -C. Jay Kuo and Fabien Scalzo and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2108.04938},
year = {2021}
}
备注
10 pages, 8 figures, Accepted in ICCV workshop