SALSA-V: 基于捷径增强的长时同步视频音频生成
声音
2025-10-06 v1 机器学习
摘要
我们提出 SALSA-V,一个能够从无声视频内容合成高度同步、高保真长时音频的多模态视频到音频生成模型。我们的方法引入掩码扩散目标,实现音频条件生成以及不受约束长度的音频序列无缝合成。此外,通过在训练过程中集成捷径损失,我们仅需八个采样步骤即可快速生成高质量音频样本,为实现近实时应用铺平道路,无需专门的微调或重新训练。定量评估和人类听音实验表明,SALSA-V 在音视频对齐和与视频内容同步方面显著优于现有最先进方法。此外,训练中随机掩码的使用使模型能够匹配参考音频样本的频谱特征,拓展了其在专业音频合成任务(如拟音生成和声音设计)中的应用范围。
引用
@article{arxiv.2510.02916,
title = {SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos},
author = {Amir Dellali and Luca A. Lanzendörfer and Florian Grötschla and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2510.02916},
year = {2025}
}