中文

面向视觉问答的逻辑一致损失

计算机视觉与模式识别 2020-11-23 v1 人工智能

摘要

给定一幅图像、背景知识和关于某一对象的一组问题,人类学习者在面对不同问题形式与语义任务时仍能非常一致地作答。当前基于神经网络的视觉问答(VQA)虽性能令人瞩目,却因独立同分布(i.i.d.)假设而无法确保此种一致性。我们提出一种与模型无关的新逻辑约束,通过在多任务学习框架中构建逻辑一致损失,以及一种称为族批次与混合批次的数据组织方式来应对该问题。为证明此方案的有效性,我们训练并评估了带与不带所提逻辑一致损失及数据组织的基于 MAC-net 的 VQA 机器。实验证实,所提损失公式与混合批次的引入带来了更高的一致性以及更优的性能。尽管所提方法在 MAC-net 上测试,只要答案间存在逻辑一致性,它便可应用于任何其他 QA 方法。

关键词

引用

@article{arxiv.2011.10094,
  title  = {Logically Consistent Loss for Visual Question Answering},
  author = {Anh-Cat Le-Ngo and Truyen Tran and Santu Rana and Sunil Gupta and Svetha Venkatesh},
  journal= {arXiv preprint arXiv:2011.10094},
  year   = {2020}
}

备注

10 pages, 6 figure, 9 tables