中文

SALSA-V: 基于捷径增强的长时同步视频音频生成

声音 2025-10-06 v1 机器学习

摘要

我们提出 SALSA-V,一个能够从无声视频内容合成高度同步、高保真长时音频的多模态视频到音频生成模型。我们的方法引入掩码扩散目标,实现音频条件生成以及不受约束长度的音频序列无缝合成。此外,通过在训练过程中集成捷径损失,我们仅需八个采样步骤即可快速生成高质量音频样本,为实现近实时应用铺平道路,无需专门的微调或重新训练。定量评估和人类听音实验表明,SALSA-V 在音视频对齐和与视频内容同步方面显著优于现有最先进方法。此外,训练中随机掩码的使用使模型能够匹配参考音频样本的频谱特征,拓展了其在专业音频合成任务(如拟音生成和声音设计)中的应用范围。

关键词

引用

@article{arxiv.2510.02916,
  title  = {SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos},
  author = {Amir Dellali and Luca A. Lanzendörfer and Florian Grötschla and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2510.02916},
  year   = {2025}
}