中文

面向多模态视网膜图像描述生成的上下文化关键词表示

计算机视觉与模式识别 2021-04-27 v1 人工智能 计算与语言 信息检索 多媒体

摘要

医学图像描述生成可自动生成医学描述以刻画给定医学图像的内容。传统的医学图像描述模型仅基于单一医学图像输入来创建医学描述。因此,基于传统方法难以生成抽象的医学描述或概念。这种方法限制了医学图像描述生成的效果。多模态医学图像描述生成是用于解决该问题的方法之一。在多模态医学图像描述生成中,文本输入(例如专家定义的关键词)被视为医学描述生成的主要驱动因素之一。因此,对文本输入与医学图像的有效编码对该任务均十分重要。本工作提出了一种新的端到端深度多模态医学图像描述生成模型。该模型利用上下文化关键词表示、文本特征增强以及掩码自注意力来构建。基于现有多模态医学图像描述生成数据集的评估,实验结果表明,与最先进方法相比,所提模型有效,其BLEU-avg提升53.2%,CIDEr提升18.6%。

关键词

引用

@article{arxiv.2104.12471,
  title  = {Contextualized Keyword Representations for Multi-modal Retinal Image Captioning},
  author = {Jia-Hong Huang and Ting-Wei Wu and Marcel Worring},
  journal= {arXiv preprint arXiv:2104.12471},
  year   = {2021}
}

备注

This paper is accepted by ACM International Conference on Multimedia Retrieval (ICMR), 2021