面向循环图像标注的语义正则化方法
计算机视觉与模式识别
2016-11-18 v1
摘要
“CNN-RNN”设计模式正日益广泛地应用于包括多标签分类和图像描述在内的多种图像标注任务中。现有模型使用弱语义的CNN隐藏层或其变换作为图像嵌入,以提供CNN与RNN之间的接口。这使得RNN负担过重,需同时承担两项任务:预测视觉概念并对其相关性建模以生成结构化的标注输出。重要的是,由于通过RNN反向传播梯度来训练CNN的困难,这使得CNN和RNN的端到端训练变得缓慢且低效。我们提出了一种对该设计模式的简单修改,使学习过程更有效、更高效。具体而言,我们建议使用一个语义正则化的嵌入层作为CNN与RNN之间的接口。对该接口进行正则化可以部分或完全解耦学习问题,使每个部分都能得到更有效的训练,并使联合训练的效率大大提高。大量实验表明,该方法在多标签分类和图像描述任务上均达到了最先进的性能。
引用
@article{arxiv.1611.05490,
title = {Semantic Regularisation for Recurrent Image Annotation},
author = {Feng Liu and Tao Xiang and Timothy M. Hospedales and Wankou Yang and Changyin Sun},
journal= {arXiv preprint arXiv:1611.05490},
year = {2016}
}