基于隐扩散模型的 DCASE 2023 挑战赛任务 7 拟音生成系统
声音
2023-09-18 v3 多媒体
音频与语音处理
摘要
拟音为多媒体内容提供背景声音,拟音的生成涉及利用专门技术对音效进行计算建模。在本工作中,我们针对 DCASE 2023 挑战赛任务 7(拟音合成)提出了一个系统。所提系统基于 AudioLDM,这是一个基于扩散的文本到音频生成模型。为缓解数据饥渴问题,该系统首先使用大规模数据集进行训练,然后通过迁移学习迁移到该 DCASE 任务中。通过实验,我们发现编码器提取的特征会显著影响生成模型的性能。因此,我们通过利用输入标签与由重要语言模型(即对比语言-音频预训练(CLAP))获得的相关文本嵌入特征来改进结果。此外,我们采用一种过滤策略进一步精炼输出,即根据声音与目标标签之间的相似度分数从生成的候选片段中选出最佳结果。整体系统在全部七个不同类别上平均取得了 4.765 的 Frechet 音频距离(FAD)分数,大幅优于基线系统的 9.7 FAD 分数。
引用
@article{arxiv.2305.15905,
title = {Latent Diffusion Model Based Foley Sound Generation System For DCASE Challenge 2023 Task 7},
author = {Yi Yuan and Haohe Liu and Xubo Liu and Xiyuan Kang and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2305.15905},
year = {2023}
}
备注
DCASE 2023 task 7 technical report, ranked 1st in the challenge