中文

Omni-Customizer:用于联合音视频生成的端到端多模态定制

计算机视觉与模式识别 2026-05-19 v1 多媒体 声音

摘要

联合音视频生成的领域已被强大基础模型的出现所根本性地改变。尽管取得了这些进步,但要实现跨多个相互作用主体在视觉身份和声学音色的同时保持的协同多模态定制,仍 largely 未被探索。为填补这一差距,我们提出 Omni-Customizer,一个面向精确绑定和无缝融合多模态身份信息的端到端框架。具体而言,我们引入 Omni-Context Fusion (OCF) 模块,通过稠密的多模态身份线索丰富基准文本提示,并设计一个 Masked TTS Cross-Attention (MTP-CA) 机制,旨在显著防止严重的"语音泄漏"问题。在此架构中,我们提出语义锚定多模态旋转位置编码 (SA-MRoPE),将视觉和音频参考标记以及 TTS 嵌入锚定到其对应的语义描述,从而实现结构化的多模态融合和稳健的身份绑定。此外,我们构筑了一整套训练策略,包含交错的音视频调度以快速适应多语言场景而不损害基础先验,并采用渐进的单对间到跨对间课程来促进高级和稳健身份特征的学习。大量实验表明,Omni-Customizer 在双模态定制生成中实现了最佳性能,在视觉身份相似性、音色一致性、精确音视频同步以及整体视频音频保真度方面均表现卓越。

关键词

引用

@article{arxiv.2605.17488,
  title  = {Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation},
  author = {Yuheng Chen and Qingdong He and Teng Hu and Yuji Wang and Yabiao Wang and Lizhuang Ma and Jiangning Zhang},
  journal= {arXiv preprint arXiv:2605.17488},
  year   = {2026}
}