中文

基于偏好学习的视频-音频联合生成中的时间同步增强:SyncDPO

计算机视觉与模式识别 2026-05-13 v1

摘要

最近的视频-音频联合生成技术在语义对应方面取得了显著进展。然而,实现精确的时间同步——即对音频事件与其视觉触发器进行细粒度对齐——仍是一个具有挑战性的问题。后训练方法在联合生成中占据主导地位,主要采用监督微调(Supervised Fine-Tuning),但常用的均方误差损失对细微的时间错位缺乏足够惩罚。直接偏好优化(DPO)通过引入明确的错位对手,更好地提高了时间灵敏度。本文提出一种后训练框架SyncDPO,利用DPO改进视频-音频联合生成的时间灵敏度。传统DPO管道通常依赖高成本的抽样与排序程序来构建偏好对,计算成本高昂。为提高效率,我们引入一套基于规则的on-the-fly负样本构建策略,通过扰曲时间结构而无需额外标注或抽样。我们展示,通过提供明确的负面监督(即时扰曲的视频-音频对),可有效强化时间对齐能力。相应地,我们实现了一种课程学习策略,逐步增加负样本的难度,从粗糙错位过渡到细微不一致。广泛的客观和主观实验覆盖来自四个多样化基准的测试,从环境声视频到人类语音视频,均表明SyncDPO在提升模型时间对齐能力方面显著优于其他方法。它还在分布外基准上表现出优异的泛化能力,捕捉到了内在的运动-声音动态。演示和代码已于 https://syncdpo.github.io/syncdpo/ 提供。

关键词

引用

@article{arxiv.2605.12179,
  title  = {SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning},
  author = {Xin Cheng and Xihua Wang and Ying Ba and Yuyue Wang and Kaisi Guan and Yinbo Wang and Wenpu Li and Ruihua Song},
  journal= {arXiv preprint arXiv:2605.12179},
  year   = {2026}
}

备注

Preprint. Under review