中文

V2A-DPO:面向视频到音频生成的全方位偏好优化

声音 2026-03-13 v1 多媒体 音频与语音处理

摘要

本文引入 V2A-DPO,一种为基于流的视频到音频生成(V2A)模型量身定制的新型直接偏好优化(DPO)框架,在有效地对齐生成音频与人类偏好方面包含关键适应。我们的方法包含三个核心创新:(1)AudioScore——一个综合的人类偏好对齐评分系统,用于评估合成音频的语义一致性、时间对齐和感知质量;(2)面向 DPO 优化的自动 AudioScore 驱动的大规模偏好对数据生成管道;(3)为基于流的生成模型量身定制的课程学习赋能的 DPO 优化策略。在基准 VGGSound 数据集上的实验表明,使用 V2A-DPO 优化的 Frieren 和 MMAudio 在人类偏好对齐方面优于使用去噪扩散政策优化(DDPO)优化的模型以及预训练基线。此外,我们的 DPO 优化后的 MMAudio 在多个指标上实现了最先进的性能,超越了已发布的 V2A 模型。

关键词

引用

@article{arxiv.2603.11089,
  title  = {V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation},
  author = {Nolan Chan and Timmy Gang and Yongqian Wang and Yuzhe Liang and Dingdong Wang},
  journal= {arXiv preprint arXiv:2603.11089},
  year   = {2026}
}

备注

Accepted at ICASSP2026