听声移动:改进生成对抗网络在agnostic声码到视频生成中的一致性
声音
2024-06-25 v1 图形学
音频与语音处理
摘要
深度生成模型已展现出创建逼真音视频内容的能力,有时会受到不同领域驱动。然而,视频生成中的平滑时序动力学仍是具备挑战性的问题。本工作聚焦于通用声码到视频生成,提出三项主要特征以提升生成对抗模型中的图像质量和时序一致性:三级声路由方案、用于扩展声分析的多尺度残差和膨胀循环网络,以及用于视频预测的新型循环和方向卷积层。每项提出的特征在质量和一致性方面均能提升当前最佳方法(SOTA)中常用的基线神经网络结构,其中视频预测层提供额外的时序细化。
引用
@article{arxiv.2406.16155,
title = {Listen and Move: Improving GANs Coherency in Agnostic Sound-to-Video Generation},
author = {Rafael Redondo},
journal= {arXiv preprint arXiv:2406.16155},
year = {2024}
}
备注
Full paper of the homonym paper published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"