中文

视觉对话中基于多结构常识知识的推理

计算机视觉与模式识别 2022-04-12 v1 多媒体

摘要

视觉对话要求智能体基于图像与人类进行对话。许多视觉对话研究聚焦于对话历史或图像内容的理解,而大量需要常识的问题被忽视。处理这些场景依赖于需要常识先验的逻辑推理。如何获取与历史和图像互补的相关常识知识仍是一项关键挑战。本文提出一种通过多结构常识知识推理(Reasoning with Multi-structure Commonsense Knowledge, RMK)的新模型。在我们的模型中,外部知识以句子级事实和图级事实表示,以恰当适配对话历史与图像复合的场景。基于这些多结构表示,我们的模型可通过基于图的交互与基于Transformer的融合,捕获相关知识并将其融入视觉与语义特征。在VisDial v1.0和VisDialCK数据集上的实验结果与分析表明,我们所提模型有效优于对比方法。

关键词

引用

@article{arxiv.2204.04680,
  title  = {Reasoning with Multi-Structure Commonsense Knowledge in Visual Dialog},
  author = {Shunyu Zhang and Xiaoze Jiang and Zequn Yang and Tao Wan and Zengchang Qin},
  journal= {arXiv preprint arXiv:2204.04680},
  year   = {2022}
}

备注

MULA Workshop, CVPR 2022