中文

听声移动:改进生成对抗网络在agnostic声码到视频生成中的一致性

声音 2024-06-25 v1 图形学 音频与语音处理

摘要

深度生成模型已展现出创建逼真音视频内容的能力,有时会受到不同领域驱动。然而,视频生成中的平滑时序动力学仍是具备挑战性的问题。本工作聚焦于通用声码到视频生成,提出三项主要特征以提升生成对抗模型中的图像质量和时序一致性:三级声路由方案、用于扩展声分析的多尺度残差和膨胀循环网络,以及用于视频预测的新型循环和方向卷积层。每项提出的特征在质量和一致性方面均能提升当前最佳方法(SOTA)中常用的基线神经网络结构,其中视频预测层提供额外的时序细化。

关键词

引用

@article{arxiv.2406.16155,
  title  = {Listen and Move: Improving GANs Coherency in Agnostic Sound-to-Video Generation},
  author = {Rafael Redondo},
  journal= {arXiv preprint arXiv:2406.16155},
  year   = {2024}
}

备注

Full paper of the homonym paper published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"