$\mathbb{VD}$-$\mathbb{GR}$:用级联时空多模态$\mathbb{GR}$aph提升视觉对话
计算机视觉与模式识别
2023-10-26 v1
摘要
我们提出 -——一种将预训练语言模型(LMs)与图神经网络(GNNs)相结合的新型视觉对话模型。先前工作主要以牺牲另一类模型为代价关注其中一类,从而错失结合二者各自优势的机会。- 的核心是一种新颖的集成机制,其在时空多模态GNNs与BERT层之间交替,并涵盖三项 distinct 贡献:首先,我们使用多模态GNNs处理各模态(图像、问题和对话历史)特征,并在执行BERT全局注意力前利用其局部结构。其次,我们提出 hub-nodes,其链接至一个模态图内的所有其他节点,使模型能以级联方式将信息从一个GNN(模态)传播到另一个。第三,我们在将BERT隐状态传入下一 - 层前,用细粒度多模态GNN特征对其进行增强。在VisDial v1.0、VisDial v0.9、VisDialConv和VisPro上的评估表明,- 在所有四个数据集上均取得新的最先进结果。
引用
@article{arxiv.2310.16590,
title = {$\mathbb{VD}$-$\mathbb{GR}$: Boosting $\mathbb{V}$isual $\mathbb{D}$ialog with Cascaded Spatial-Temporal Multi-Modal $\mathbb{GR}$aphs},
author = {Adnen Abdessaied and Lei Shi and Andreas Bulling},
journal= {arXiv preprint arXiv:2310.16590},
year = {2023}
}
备注
WACV 2024