中文

自监督视听声景风格化

计算机视觉与模式识别 2024-09-24 v1 机器学习 多媒体 声音 音频与语音处理

摘要

语音声传达了大量关于场景的信息,产生了从混响到附加环境声等多种效果。在本文中,我们在给定从某场景录制的视听条件样本的情况下,对输入语音进行操控,使其听起来如同在该场景内录制一般。我们的模型通过自监督进行学习,利用了自然视频包含重复声音事件与纹理的特性。我们从视频中提取一段音频片段并应用语音增强。随后,我们训练一个 latent diffusion 模型来恢复原始语音,并将取自视频中其他位置的另一段视听片段作为条件提示。通过这一过程,模型学会了将条件样本的声音属性迁移到输入语音中。我们表明,我们的模型可以使用无标签的野外视频成功训练,并且额外的视觉信号可以提升其声音预测能力。请参阅我们的项目网页以查看视频结果:https://tinglok.netlify.app/files/avsoundscape/

关键词

引用

@article{arxiv.2409.14340,
  title  = {Self-Supervised Audio-Visual Soundscape Stylization},
  author = {Tingle Li and Renhao Wang and Po-Yao Huang and Andrew Owens and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2409.14340},
  year   = {2024}
}

备注

ECCV 2024