一种用于提升视觉问答模型收敛性与准确性的简单损失函数
计算机视觉与模式识别
2017-08-03 v1
摘要
视觉问答作为最近提出的多模态学习任务,受到了深度学习社区的广泛关注。最近,重点在于开发新的表示融合方法和注意力机制以实现卓越的性能。另一方面,对模型的损失函数的关注却很少,而损失函数可以说是训练深度学习模型最重要的方面之一。普遍的做法是使用交叉熵损失函数,它会对词汇表中除特定问题唯一最常见答案之外的所有答案所赋予的概率进行惩罚。然而,VQA 评估函数将预测答案与给定问题的所有真实答案进行比较,如果存在匹配,则给予部分分数。这导致了模型的交叉熵损失与 VQA 评估函数计算出的模型准确性之间存在差异。在这项工作中,我们提出了一种新的损失函数,称为软交叉熵,它考虑了所有真实答案,从而减少了损失与准确性之间的差异。所提出的损失函数改善了 VQA 模型的训练收敛性,并使准确性提高了 1.6%。
引用
@article{arxiv.1708.00584,
title = {A Simple Loss Function for Improving the Convergence and Accuracy of Visual Question Answering Models},
author = {Ilija Ilievski and Jiashi Feng},
journal= {arXiv preprint arXiv:1708.00584},
year = {2017}
}
备注
accepted at CVPR 2017 VQA workshop