图关系 Transformer:将成对对象特征引入 Transformer 架构
计算机视觉与模式识别
2021-11-12 v1
摘要
先前的研究如 VizWiz 发现,能够读取并推理图像中文本的可视化问答(VQA)系统在辅助视障人士等应用领域中很有用。TextVQA 是一个面向该问题的 VQA 数据集,其中的问题要求回答系统读取并推理图像中的视觉对象和文本对象。TextVQA 的一个关键挑战是设计一种系统,不仅能有效地分别推理视觉和文本对象,还能推理这些对象之间的空间关系。这促使了“边特征”(即关于每对对象之间关系的信息)的使用。当前一些 TextVQA 模型解决了该问题,但要么仅使用关系类别(而非边特征向量),要么未在 Transformer 架构中使用边特征。为克服这些不足,我们提出了图关系 Transformer(GRT),它在 Transformer 中除节点信息外还使用边信息进行图注意力计算。我们发现,在不使用任何其他优化的情况下,所提出的 GRT 方法在验证集上比 M4C 基线模型的准确率高出 0.65%,在测试集上高出 0.57%。从定性上看,我们观察到 GRT 具有优于 M4C 的空间推理能力。
引用
@article{arxiv.2111.06075,
title = {Graph Relation Transformer: Incorporating pairwise object features into the Transformer architecture},
author = {Michael Yang and Aditya Anantharaman and Zachary Kitowski and Derik Clive Robert},
journal= {arXiv preprint arXiv:2111.06075},
year = {2021}
}
备注
Presented as poster in CVPR 2021 Visual Question Answering Workshop