中文

AudioSetMix:利用大语言模型辅助增强音频-语言数据集

音频与语音处理 2024-06-10 v2 计算与语言 多媒体 声音

摘要

近年来,音频-语言领域的多模态学习取得了显著进展。然而,音频-语言学习面临数据有限且质量较低的挑战,尤其在与图像-语言任务相比。现有音频-语言数据集规模较小,手动标注受限于需完整聆听音频片段以获得准确标签。我们的方法通过系统性地对音频片段进行增广,生成包含自然语言标签及相应音频信号处理操作的音频-描述配对。运用大语言模型,我们使用提示模板生成增广后音频片段的描述。这种可扩展的方法构建了 AudioSetMix 数据集,作为文本与音频相关模型的高质量训练数据。我们的数据集集成后可提升模型在多个基准测试上的性能,提供更丰富且更精准对齐的样本。值得注意的是,我们的数据集弥补了现有数据集中缺失修饰词(形容词和副词)的不足。通过使模型学习这些概念,并在训练期生成硬负例,我们在多个基准测试上实现了最新性能。

关键词

引用

@article{arxiv.2405.11093,
  title  = {AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations},
  author = {David Xu},
  journal= {arXiv preprint arXiv:2405.11093},
  year   = {2024}
}

备注

typos corrected