带隐式对齐的视频到音频生成
声音
2025-03-12 v3 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
根据视频输入生成语义和时间上对齐的音频内容已成为研究者关注的焦点,尤其值得注意的是,自 text-to-video 生成突破后,本研究旨在为视频到音频生成范式提供见解,重点关注三个关键方面:视觉编码器、辅助嵌入和数据增强技术。我们以一种简单却出乎意料有效的直觉为基础构建模型,通过消融研究探索各种视觉编码器和辅助嵌入。我们采用全面的评估管道,强调生成质量和视频-音频同步对齐,证明我们的模型在视频到音频生成方面达到了最先进的水平。此外,我们提供了关于不同数据增强方法对整体能力提升的关键见解。我们展示了从语义和时间视角推进同步音频生成挑战的可能性。我们希望这些见解将为开发更真实和准确的音视频生成模型提供一步脚印。
引用
@article{arxiv.2407.07464,
title = {Video-to-Audio Generation with Hidden Alignment},
author = {Manjie Xu and Chenxing Li and Xinyi Tu and Yong Ren and Rilin Chen and Yu Gu and Wei Liang and Dong Yu},
journal= {arXiv preprint arXiv:2407.07464},
year = {2025}
}
备注
https://sites.google.com/view/vta-ldm