中文

基于多视角潜在交换联合扩散的二维长时段潜在生成

声音 2025-07-30 v3 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

本文介绍了Swap Forward (SaFa),一种模块无关且高效的方法,通过在多视角之间进行潜在交换联合扩散,以生成无缝且连贯的长时段频谱和全景图像。我们首先研究了基于现有联合扩散方法在频谱音频生成中引发的频谱别名问题。通过对Mel频谱和RGB图像VAE潜在表示的比较分析,我们发现问题源于频谱去噪过程中由于平均算子导致的高频分量过度抑制。为解决此问题,我们提出了帧级双向交换(Self-Loop Latent Swap),用于相邻视角重叠区域的潜在交换。利用相邻子视图的分步差分轨迹,该交换算子自适应地增强高频分量,避免频谱失真。此外,为提高非重叠区域的全局跨视图一致性,我们引入参考引导潜在交换(Reference-Guided Latent Swap),一种单向潜在交换算子,提供中心化参考轨迹以同步子视图的扩散。通过细化交换时机和间隔,我们能够以仅使用前向过程的方式实现跨视图的相似性-多样性平衡。定量和定性实验表明,SaFa在使用U-Net和DiT模型进行音频生成时,显著优于现有联合扩散方法,甚至优于基于训练的方法,同时有效适应更长的长度。它在全景生成方面也表现出色,实现了与现有方法相当的性能,同时速度提升2至20倍且模型通用性更强。更多生成演示可在 https://swapforward.github.io/ 查看。

关键词

引用

@article{arxiv.2502.05130,
  title  = {Latent Swap Joint Diffusion for 2D Long-Form Latent Generation},
  author = {Yusheng Dai and Chenxi Wang and Chang Li and Chen Wang and Jun Du and Kewei Li and Ruoyu Wang and Jiefeng Ma and Lei Sun and Jianqing Gao},
  journal= {arXiv preprint arXiv:2502.05130},
  year   = {2025}
}