自监督视听声景风格化
计算机视觉与模式识别
2024-09-24 v1 机器学习
多媒体
声音
音频与语音处理
摘要
语音声传达了大量关于场景的信息,产生了从混响到附加环境声等多种效果。在本文中,我们在给定从某场景录制的视听条件样本的情况下,对输入语音进行操控,使其听起来如同在该场景内录制一般。我们的模型通过自监督进行学习,利用了自然视频包含重复声音事件与纹理的特性。我们从视频中提取一段音频片段并应用语音增强。随后,我们训练一个 latent diffusion 模型来恢复原始语音,并将取自视频中其他位置的另一段视听片段作为条件提示。通过这一过程,模型学会了将条件样本的声音属性迁移到输入语音中。我们表明,我们的模型可以使用无标签的野外视频成功训练,并且额外的视觉信号可以提升其声音预测能力。请参阅我们的项目网页以查看视频结果:https://tinglok.netlify.app/files/avsoundscape/
引用
@article{arxiv.2409.14340,
title = {Self-Supervised Audio-Visual Soundscape Stylization},
author = {Tingle Li and Renhao Wang and Po-Yao Huang and Andrew Owens and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2409.14340},
year = {2024}
}
备注
ECCV 2024