STA-V2A:具有语义和时间对齐的视频到音频生成
声音
2025-03-25 v2 多媒体
音频与语音处理
摘要
视觉和听觉感知是人类体验世界的两种重要方式。文本到视频生成在过去一年取得了显著进展,但生成视频中缺乏和谐的音频限制了其更广泛的应用。在本文中,我们提出了语义和时间对齐的视频到音频生成(STA-V2A),该方法通过提取局部时间和全局语义视频特征,并将这些精炼的视频特征与文本结合作为跨模态引导,来增强从视频生成音频。为了解决视频中信息冗余的问题,我们提出了一个用于局部时间特征提取的起始点预测预训练任务和一个用于全局语义特征提取的注意力池化模块。为了补充视频中不足的语义信息,我们提出了一个具有文本到音频先验初始化和跨模态引导的潜在扩散模型。我们还引入了Audio-Audio Align,一种评估音频时间对齐的新指标。主观和客观指标表明,我们的方法在生成具有更好质量、语义一致性和时间对齐的音频方面超越了现有的视频到音频模型。消融实验验证了每个模块的有效性。音频样本可在https://y-ren16.github.io/STAV2A获取。
引用
@article{arxiv.2409.08601,
title = {STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment},
author = {Yong Ren and Chenxing Li and Manjie Xu and Wei Liang and Yu Gu and Rilin Chen and Dong Yu},
journal= {arXiv preprint arXiv:2409.08601},
year = {2025}
}
备注
ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)