中文

野外多模态视频对话状态跟踪

计算机视觉与模式识别 2024-07-08 v2

摘要

我们提出了MST-MIXER——一种新型视频对话模型, operates over a generic multi-modal state tracking scheme。当前声称执行多模态状态跟踪的模型在两个主要方面不足:(1)它们仅跟踪一种模态(主要是视觉输入),或(2)它们针对的合成数据集不反映真实世界情境的复杂性。我们的模型旨在弥合这一关键研究空白。具体而言,MST-MIXER首先跟踪每个输入模态最重要的组成部分。随后,通过学习新颖的多模态图结构学习方法,预测所选组成部分每个模态的缺失底层结构。随后,将所学习的局部图和特征一起解析,形成在所有模态混合上运行的全局图,以进一步细化其结构和节点嵌入。最后,使用细粒度图节点特征来增强背后的视觉语言模型(VLM)的隐藏状态。MST-MIXER在五个具有挑战性的基准测试中实现了新的状态-of-the-art结果。

关键词

引用

@article{arxiv.2407.02218,
  title  = {Multi-Modal Video Dialog State Tracking in the Wild},
  author = {Adnen Abdessaied and Lei Shi and Andreas Bulling},
  journal= {arXiv preprint arXiv:2407.02218},
  year   = {2024}
}

备注

ECCV 2024