中文

LAV:基于神经压缩与 StyleGAN2 的音频驱动动态视觉生成

声音 2026-04-16 v1 人工智能 图形学 多媒体 音频与语音处理

摘要

本文提出 LAV(Latent Audio-Visual),该系统将 EnCodec 的神经音频压缩与 StyleGAN2 的生成能力相结合,以预录音频为驱动生成视觉动态输出。与依赖显式特征映射的先前工作不同,LAV 将 EnCodec 嵌入用作潜在表示,通过随机初始化的线性映射直接转换至 StyleGAN2 的风格潜在空间。该方法在转换过程中保留了语义丰富性,实现了精细且语义连贯的音视频转换。该框架展示了利用预训练音频压缩模型进行艺术与计算应用的潜力。

关键词

引用

@article{arxiv.2505.10101,
  title  = {LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2},
  author = {Jongmin Jung and Dasaem Jeong},
  journal= {arXiv preprint arXiv:2505.10101},
  year   = {2026}
}

备注

Paper accepted at ISEA 2025, The 30th International Symposium on Electronic/Emerging Art, Seoul, Republic of Korea, 23 - 29 May 2025