中文

Synthio:用于合成数据增强小规模音频分类数据集

音频与语音处理 2025-03-13 v2 人工智能 计算与语言

摘要

我们提出 Synthio,一种用于增强小规模音频分类数据集的新方法。我们的目标是利用有限标记数据提高音频分类准确率。传统数据增强技术(例如添加随机噪声或掩码片段)难以创建捕捉真实世界音频所呈现多样性的数据。为此,我们提出使用来自文本到音频(T2A)扩散模型的合成音频来增强数据集。然而,合成有效的数据增强具有挑战,因为生成的数据不仅要在声学上与小规模数据集一致,而且要具有足够的组合多样性。为克服第一个挑战,我们采用偏好优化将 T2A 模型的生成与小规模数据集对齐。这确保了生成数据的声学特征与小规模数据集一致。为解决第二个挑战,我们提出一种新型的标题生成技术,利用大型语言模型的推理能力实现:(1)生成多样且有意义的音频标题;(2)迭代细化其质量。生成的标题随后用于提示对齐后的 T2A 模型。我们在十个数据集和四个模拟的有限数据设置上进行了广泛评估。结果表明,该方法在仅使用弱标记的 AudioSet 训练的 T2A 模型下, consistently 超过所有基线方法,提升幅度为 0.1%~39%。

关键词

引用

@article{arxiv.2410.02056,
  title  = {Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data},
  author = {Sreyan Ghosh and Sonal Kumar and Zhifeng Kong and Rafael Valle and Bryan Catanzaro and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2410.02056},
  year   = {2025}
}

备注

Accepted at ICLR 2025. Code and Checkpoints available here: https://github.com/Sreyan88/Synthio