用于医学报告生成的辅助信号引导知识编解码器
计算机视觉与模式识别
2020-06-09 v1 计算与语言
图像与视频处理
摘要
除了自然图像描述所面临的常见困难外,医学报告生成特别要求模型以细粒度且语义连贯的段落描述医学图像,该段落应满足医学常识与逻辑。先前的工作通常提取全局图像特征,并尝试生成与参考报告相似的段落;然而,这种方法有两个局限。首先,放射科医生主要关注的区域通常位于全局图像的一小块区域内,这意味着图像的其余部分在训练过程中可被视为无关噪声。其次,每份医学报告中用于描述图像正常区域的相似句子很多,这导致了严重的数据偏差。这种偏差很可能使模型定期生成这些不必要的句子。为解决这些问题,我们提出了一种辅助信号引导知识编解码器(ASGK)来模拟放射科医生的工作模式。更具体地,ASGK 整合内部视觉特征融合与外部医学语言信息,以引导医学知识迁移与学习。ASGK 的核心结构由受先进生成式预训练(GPT)启发的医学图编码器与自然语言解码器组成。在 CX-CHR 数据集和我们的 COVID-19 CT Report 数据集上的实验表明,我们提出的 ASGK 能够生成稳健且准确的报告,并且在医学术语分类和段落生成指标上均优于最先进的方法。
引用
@article{arxiv.2006.03744,
title = {Auxiliary Signal-Guided Knowledge Encoder-Decoder for Medical Report Generation},
author = {Mingjie Li and Fuyu Wang and Xiaojun Chang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2006.03744},
year = {2020}
}
备注
11 pages, 3 figures