用于图像描述和视觉问答的自动解析网络
计算机视觉与模式识别
2021-08-25 v1
摘要
我们提出了一种自动解析网络(APN),用于发现和利用输入数据中隐藏的树结构,以提高基于 Transformer 的视觉-语言系统的有效性。具体来说,我们在每个自注意力层上施加一个由注意力操作参数化的概率图模型(PGM),以引入稀疏性假设。我们使用这个 PGM 将输入序列软分割成几个簇,其中每个簇可以被视为内部实体的父节点。通过堆叠这些受 PGM 约束的自注意力层,较低层的簇组合成一个新的序列,而较高层的 PGM 将进一步分割这个序列。迭代地,可以隐式解析出一棵稀疏树,并且这棵树的层次知识被整合到转换后的嵌入中,这些嵌入可用于解决目标视觉-语言任务。具体来说,我们展示了我们的 APN 可以增强基于 Transformer 的网络在两项主要视觉-语言任务中的表现:图像描述和视觉问答。此外,我们还开发了一种基于 PGM 概率的解析算法,通过该算法我们可以在推理过程中发现输入的隐藏结构。
引用
@article{arxiv.2108.10568,
title = {Auto-Parsing Network for Image Captioning and Visual Question Answering},
author = {Xu Yang and Chongyang Gao and Hanwang Zhang and Jianfei Cai},
journal= {arXiv preprint arXiv:2108.10568},
year = {2021}
}