显示、编辑与叙述:一种编辑图像字幕的框架
计算机视觉与模式识别
2020-03-09 v1
摘要
大多数图像字幕框架直接从图像生成字幕,学习从视觉特征到自然语言的映射。然而,编辑现有字幕可能比从头生成新字幕更容易。直观上,在编辑字幕时,模型不需要学习字幕中已经存在的信息(即句子结构),使其能够专注于修正细节(例如替换重复单词)。本文提出了一种基于现有字幕的迭代自适应精炼的新型图像字幕方法。具体地,我们的字幕编辑模型由两个子模块组成:(1) EditNet,一个具有自适应复制机制(Copy-LSTM)和选择性复制记忆注意力机制(SCMA)的语言模块,以及(2) DCNet,一个基于 LSTM 的去噪自编码器。这些组件使我们的模型能够直接复制和修改现有字幕。实验表明,我们的新方法在 MS COCO 数据集上无论有无序列级训练都达到了最先进的性能。
引用
@article{arxiv.2003.03107,
title = {Show, Edit and Tell: A Framework for Editing Image Captions},
author = {Fawaz Sammani and Luke Melas-Kyriazi},
journal= {arXiv preprint arXiv:2003.03107},
year = {2020}
}
备注
Accepted to CVPR 2020