中文

面向高保真开放领域视频到音频生成的模型导向双角色对齐

声音 2025-10-29 v1 人工智能 多媒体 音频与语音处理

摘要

我们提出 MGAudio,一个新颖的基于流的框架用于开放领域视频到音频生成,其中引入模型导向双角色对齐作为核心设计原则。不同于依赖分类器或无分类器指导的先前方法,MGAudio 使生成模型能够通过专为视频条件音频生成设计的专用训练目标自我引导。该框架集成了三个主要组件:(1)一个可扩展的基于流的 Transformer 模型,(2)一个双角色对齐机制,其中音视频编码器既作为条件模块又作为特征对齐器以提高生成质量,(3)一个模型导向目标增强跨模态一致性和音频真实性。MGAudio 在 VGGSound 上实现了最先进的性能,将 FAD 降至 0.40,显著超过最佳无分类器指导基线,持续在 FD、IS 和对齐指标上优于现有方法。它还在具有挑战性的 UnAV-100 数据集上表现良好。这些结果突显了模型导向双角色对齐作为条件视频到音频生成的强大且可扩展的范式。代码请参见:https://github.com/pantheon5100/mgaudio

关键词

引用

@article{arxiv.2510.24103,
  title  = {Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation},
  author = {Kang Zhang and Trung X. Pham and Suyeon Lee and Axi Niu and Arda Senocak and Joon Son Chung},
  journal= {arXiv preprint arXiv:2510.24103},
  year   = {2025}
}

备注

accepted by NeurIPS 2025