面向多模态视网膜图像描述生成的上下文化关键词表示
计算机视觉与模式识别
2021-04-27 v1 人工智能
计算与语言
信息检索
多媒体
摘要
医学图像描述生成可自动生成医学描述以刻画给定医学图像的内容。传统的医学图像描述模型仅基于单一医学图像输入来创建医学描述。因此,基于传统方法难以生成抽象的医学描述或概念。这种方法限制了医学图像描述生成的效果。多模态医学图像描述生成是用于解决该问题的方法之一。在多模态医学图像描述生成中,文本输入(例如专家定义的关键词)被视为医学描述生成的主要驱动因素之一。因此,对文本输入与医学图像的有效编码对该任务均十分重要。本工作提出了一种新的端到端深度多模态医学图像描述生成模型。该模型利用上下文化关键词表示、文本特征增强以及掩码自注意力来构建。基于现有多模态医学图像描述生成数据集的评估,实验结果表明,与最先进方法相比,所提模型有效,其BLEU-avg提升53.2%,CIDEr提升18.6%。
引用
@article{arxiv.2104.12471,
title = {Contextualized Keyword Representations for Multi-modal Retinal Image Captioning},
author = {Jia-Hong Huang and Ting-Wei Wu and Marcel Worring},
journal= {arXiv preprint arXiv:2104.12471},
year = {2021}
}
备注
This paper is accepted by ACM International Conference on Multimedia Retrieval (ICMR), 2021