基于联合损失最小化训练循环回答单元的视觉问答
计算机视觉与模式识别
2016-10-03 v2
摘要
我们提出了一种基于循环深度神经网络的视觉问答新算法,其中网络中的每个模块本身就是一个带有注意力机制的完整回答单元。该网络通过最小化从所有单元聚合的损失进行优化,这些单元共享模型参数,同时接收不同的信息以计算注意力概率。在训练过程中,我们的模型关注图像特征图内的某个区域,根据问题和所关注的图像特征更新其记忆,并根据其记忆状态回答问题。此过程在每一步中执行以计算损失。该方法的动机源于我们的观察:回答问题通常需要多步推理,而每个问题可能具有唯一的最优步数,这在实践中难以确定。因此,我们始终让网络中的第一个单元解决问题,但允许它通过反向传播从其余单元学习知识,除非这会降低模型性能。为了实现这一想法,我们在每个单元开始过拟合时尽早停止其训练。注意,由于更复杂的模型往往会在简单问题上迅速过拟合,展开的循环神经网络中最后一个回答单元通常最先被终止,而第一个单元则保留到最后。我们使用共享模型对新问题进行单步预测。在我们的框架内,该策略优于其他选项,因为所选模型在未过拟合的情况下有效地从所有单元中进行了训练。所提出的算法在 VQA 数据集上使用单步预测优于其他基于多步注意力的方法。
引用
@article{arxiv.1606.03647,
title = {Training Recurrent Answering Units with Joint Loss Minimization for VQA},
author = {Hyeonwoo Noh and Bohyung Han},
journal= {arXiv preprint arXiv:1606.03647},
year = {2016}
}