LAV:基于神经压缩与 StyleGAN2 的音频驱动动态视觉生成
声音
2026-04-16 v1 人工智能
图形学
多媒体
音频与语音处理
摘要
本文提出 LAV(Latent Audio-Visual),该系统将 EnCodec 的神经音频压缩与 StyleGAN2 的生成能力相结合,以预录音频为驱动生成视觉动态输出。与依赖显式特征映射的先前工作不同,LAV 将 EnCodec 嵌入用作潜在表示,通过随机初始化的线性映射直接转换至 StyleGAN2 的风格潜在空间。该方法在转换过程中保留了语义丰富性,实现了精细且语义连贯的音视频转换。该框架展示了利用预训练音频压缩模型进行艺术与计算应用的潜力。
引用
@article{arxiv.2505.10101,
title = {LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2},
author = {Jongmin Jung and Dasaem Jeong},
journal= {arXiv preprint arXiv:2505.10101},
year = {2026}
}
备注
Paper accepted at ISEA 2025, The 30th International Symposium on Electronic/Emerging Art, Seoul, Republic of Korea, 23 - 29 May 2025