归纳式视觉定位:因子化训练以实现更优泛化
计算机视觉与模式识别
2018-07-24 v1
摘要
端到端训练的循环神经网络(RNN)已成功应用于众多需要处理序列的问题,如图像描述、机器翻译和文本识别。然而,RNN 往往难以泛化到比训练时更长的序列。在本工作中,我们提出显式地针对归纳来优化神经网络。其思想是首先将问题分解为一系列归纳步骤,然后显式训练 RNN 以复现这些步骤。由于不允许 RNN 学习任意内部状态,而是要求其模拟有效状态的演化,从而实现了泛化。具体而言,该状态被限制为一个空间记忆图,用于跟踪输入图像中已在先前步骤中被处理过的部分。RNN 针对单个归纳步骤进行训练,在此过程中它除产生期望输出外还生成对记忆的更新。我们在两个涉及视觉序列的不同视觉识别问题上评估了我们的方法:(1)文本检测识别,即联合定位与读取包含多行(或块)文本的图像中的文本;(2)航拍图像中物体的顺序计数。我们表明,循环模型的归纳式训练增强了它们在具有挑战性的图像数据集上的泛化能力。
引用
@article{arxiv.1807.08179,
title = {Inductive Visual Localisation: Factorised Training for Superior Generalisation},
author = {Ankush Gupta and Andrea Vedaldi and Andrew Zisserman},
journal= {arXiv preprint arXiv:1807.08179},
year = {2018}
}
备注
In BMVC 2018 (spotlight)