中文

《用于视网膜图像描述的深度上下文编码网络》扩展版

计算机视觉与模式识别 2021-06-01 v1 人工智能 计算与语言 多媒体

摘要

自动生成视网膜图像的医学报告是帮助眼科医生减少工作量并提高工作效率的有前景途径之一。本工作中,我们提出一种新的上下文驱动编码网络,用于自动生成视网膜图像的医学报告。所提模型主要由多模态输入编码器与融合特征解码器组成。实验结果表明,我们提出的方法能有效利用输入图像与上下文(本例中为关键词)之间的交互信息。相较于基线模型,所提方法为视网膜图像生成了更准确且更有意义的报告,并取得了最先进的性能。该性能在医学报告生成任务的若干常用指标上得到体现:BLEU-avg(+16%)、CIDEr(+10.2%)和ROUGE(+8.6%)。

关键词

引用

@article{arxiv.2105.14538,
  title  = {Longer Version for "Deep Context-Encoding Network for Retinal Image Captioning"},
  author = {Jia-Hong Huang and Ting-Wei Wu and Chao-Han Huck Yang and Marcel Worring},
  journal= {arXiv preprint arXiv:2105.14538},
  year   = {2021}
}

备注

This paper is a longer version of "Deep Context-Encoding Network for Retinal Image Captioning" which is accepted by IEEE International Conference on Image Processing (ICIP), 2021