T-FOLEY:一种用于时间事件引导拟音合成的可控波形域扩散模型
声音
2024-01-18 v1 人工智能
机器学习
音频与语音处理
信号处理
摘要
拟音,即与视频同步插入的音频内容,在多媒体内容的用户体验中起着关键作用。近年来,利用深度生成模型的进步,拟音合成的研究十分活跃。然而,这些工作主要侧重于复现单一声音类别或文本声音描述,忽略了在实际拟音应用中至关重要的时间信息。我们提出了 T-Foley,一种用于拟音合成的、由时间事件引导的波形生成模型。T-Foley 使用两种条件生成高质量音频:声音类别和时间事件特征。对于时间条件,我们设计了一种时间事件特征和一种名为 Block-FiLM 的新型条件技术。T-Foley 在客观和主观评估指标上均表现出优越的性能,并能生成与时间事件良好同步的拟音。此外,我们展示了 T-Foley 的实际应用,特别是在涉及用于时间事件控制的语音模仿场景中。我们在配套网站上提供了演示。
引用
@article{arxiv.2401.09294,
title = {T-FOLEY: A Controllable Waveform-Domain Diffusion Model for Temporal-Event-Guided Foley Sound Synthesis},
author = {Yoonjin Chung and Junwon Lee and Juhan Nam},
journal= {arXiv preprint arXiv:2401.09294},
year = {2024}
}