中文

MAViD: 一种用于音视频对话理解与生成的多模态框架

计算机视觉与模式识别 2026-03-10 v2

摘要

我们提出 MAViD,一个用于音视频对话理解与生成的新型多模态框架。现有方法主要关注非交互式系统,且仅能生成受限和不自然的人类语音。该任务的主要挑战在于有效整合理解与生成能力,以及实现无缝的多模态音视频融合。为解决这些问题,我们提出了一种指挥者-创作者(Conductor-Creator)架构,将对话系统分为两个主要组件。指挥者负责理解、推理和生成指令,将其分解为运动和语音组件,从而实现对交互的细粒度控制。创作者则根据这些指令提供交互式响应。此外,为解决使用双 DiT 结构生成具有一致身份、音色和语调的长视频的困难,创作者采用了一种结合自回归(AR)模型和扩散模型的结构。自回归模型负责音频生成,而扩散模型确保高质量的视频生成。此外,我们提出了一种新颖的融合模块,以增强上下文连续片段和模态之间的连接,实现同步的长时长音视频内容生成。大量实验表明,我们的框架能够生成生动且上下文连贯的长时长对话交互,并准确解读用户的多模态查询。

关键词

引用

@article{arxiv.2512.03034,
  title  = {MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation},
  author = {Youxin Pang and Jiajun Liu and Lingfeng Tan and Yong Zhang and Feng Gao and Xiang Deng and Zhuoliang Kang and Xiaoming Wei and Yebin Liu},
  journal= {arXiv preprint arXiv:2512.03034},
  year   = {2026}
}