中文

KAT:面向视觉与语言的知识增强 Transformer

计算与语言 2022-05-06 v2

摘要

近期关于大规模 Transformer 的工作主要关注优化装入模型参数的信息量。在这项工作中,我们提出一个不同的问题:多模态 Transformer 能否在其推理中利用显式知识?现有的主要是单模态的方法在知识检索后进行答案预测的范式下探索了相关途径,但留下了关于所用检索知识的质量和相关性,以及如何整合隐式和显式知识上的推理过程等悬而未决的问题。为了应对这些挑战,我们提出了一种新颖的模型——知识增强 Transformer(KAT),在 OK-VQA 这一开放域多模态任务上取得了强大的最先进结果(绝对提升 6 个百分点)。我们的方法在端到端编码器-解码器架构中整合了隐式和显式知识,同时在答案生成过程中仍对两种知识源进行联合推理。显式知识整合的额外益处体现在我们分析中模型预测可解释性的提高。

关键词

引用

@article{arxiv.2112.08614,
  title  = {KAT: A Knowledge Augmented Transformer for Vision-and-Language},
  author = {Liangke Gui and Borui Wang and Qiuyuan Huang and Alex Hauptmann and Yonatan Bisk and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2112.08614},
  year   = {2022}
}

备注

Accepted by NAACL 2022