V$^2$Dial:通过多模态专家统一视频与视觉对话
计算机视觉与模式识别
2025-03-17 v2
摘要
我们提出了 VDial——一种新颖的基于专家的模型,专门用于同时处理图像和视频输入数据以应对多模态对话任务。当前的多模态模型主要关注较简单的任务(例如 VQA、VideoQA、视频文本检索),而往往忽略了更具挑战性的对话对应物,如视频和视觉/图像对话。此外,尽管两项对话任务具有明显的相似性并限制了其应用潜力,但关于这两项任务的研究却是彼此独立发展的。为此,我们提出使用单一模型统一这两项任务,该模型首次通过将图像和视频路由至专用专家来联合学习其空间和时间特征,并使用匹配和对比学习技术对其进行对齐。此外,我们通过调查这些看似相关的任务是否以及在多大程度上能从各自的训练数据中相互受益,系统性地研究了这两项任务之间的领域偏移。在广泛使用的视频和视觉对话数据集 AVSD 和 VisDial 上的广泛评估表明,无论是在零样本还是微调设置下,我们的模型在四个基准测试中均取得了新的 SOTA 结果。
引用
@article{arxiv.2503.02063,
title = {V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts},
author = {Adnen Abdessaied and Anna Rohrbach and Marcus Rohrbach and Andreas Bulling},
journal= {arXiv preprint arXiv:2503.02063},
year = {2025}
}
备注
CVPR 2025