中文

监督 VQA 中推理模式的迁移

计算机视觉与模式识别 2021-06-11 v1 机器学习

摘要

视觉问答(VQA)方法因利用数据集偏差而非进行推理而声名狼藉,这阻碍了泛化能力。最近的研究表明,当最先进 VQA 模型的注意力层在完美(预言机)视觉输入上训练时,会涌现出更好的推理模式。这证明了深度神经网络在训练条件足够有利时可以学会推理。然而,将这种习得知识迁移到可部署模型是一项挑战,因为在迁移过程中大部分知识会丢失。我们提出一种基于损失函数中正则化项的知识迁移方法,用以监督所需的推理操作序列。我们基于 PAC 学习给出理论分析,表明在温和假设下,此类程序预测可降低样本复杂度。我们还在 GQA 数据集上实验证明了该方法的有效性,并展示了其与 BERT 类自监督预训练的互补性。

关键词

引用

@article{arxiv.2106.05597,
  title  = {Supervising the Transfer of Reasoning Patterns in VQA},
  author = {Corentin Kervadec and Christian Wolf and Grigory Antipov and Moez Baccouche and Madiha Nadri},
  journal= {arXiv preprint arXiv:2106.05597},
  year   = {2021}
}