中文

$\mathbb{VD}$-$\mathbb{GR}$:用级联时空多模态$\mathbb{GR}$aph提升视觉对话

计算机视觉与模式识别 2023-10-26 v1

摘要

我们提出 VD\mathbb{VD}-GR\mathbb{GR}——一种将预训练语言模型(LMs)与图神经网络(GNNs)相结合的新型视觉对话模型。先前工作主要以牺牲另一类模型为代价关注其中一类,从而错失结合二者各自优势的机会。VD\mathbb{VD}-GR\mathbb{GR} 的核心是一种新颖的集成机制,其在时空多模态GNNs与BERT层之间交替,并涵盖三项 distinct 贡献:首先,我们使用多模态GNNs处理各模态(图像、问题和对话历史)特征,并在执行BERT全局注意力前利用其局部结构。其次,我们提出 hub-nodes,其链接至一个模态图内的所有其他节点,使模型能以级联方式将信息从一个GNN(模态)传播到另一个。第三,我们在将BERT隐状态传入下一 VD\mathbb{VD}-GR\mathbb{GR} 层前,用细粒度多模态GNN特征对其进行增强。在VisDial v1.0、VisDial v0.9、VisDialConv和VisPro上的评估表明,VD\mathbb{VD}-GR\mathbb{GR} 在所有四个数据集上均取得新的最先进结果。

关键词

引用

@article{arxiv.2310.16590,
  title  = {$\mathbb{VD}$-$\mathbb{GR}$: Boosting $\mathbb{V}$isual $\mathbb{D}$ialog with Cascaded Spatial-Temporal Multi-Modal $\mathbb{GR}$aphs},
  author = {Adnen Abdessaied and Lei Shi and Andreas Bulling},
  journal= {arXiv preprint arXiv:2310.16590},
  year   = {2023}
}

备注

WACV 2024