使用文本到音频模型生成合成训练集用于环境声分类
音频与语音处理
2024-07-09 v3 声音
信号处理
摘要
近年来,文本到音频模型在自动音频生成领域取得了显著进展。本文探讨了其在生成用于训练数据驱动模型的合成数据集方面的应用。具体而言,本研究分析了两种环境声分类系统的性能,这些系统是使用来自文本到音频模型生成的数据进行训练的。我们考虑了三种情景:a)通过文本到音频模型生成的数据来增强训练数据集;b)使用混合训练数据集,结合真实和合成文本驱动生成的数据;c)使用完全由合成音频组成的训练数据集。在所有情况下,都对分类模型在真实数据上的性能进行了测试。结果表明,文本到音频模型在数据增强方面效果良好,在替换一部分录制数据集时表现出一致性。然而,当完全依赖生成的音频时,音频识别模型的性能会下降。
引用
@article{arxiv.2403.17864,
title = {Synthetic training set generation using text-to-audio models for environmental sound classification},
author = {Francesca Ronchini and Luca Comanducci and Fabio Antonacci},
journal= {arXiv preprint arXiv:2403.17864},
year = {2024}
}