AudioSetMix:利用大语言模型辅助增强音频-语言数据集
音频与语音处理
2024-06-10 v2 计算与语言
多媒体
声音
摘要
近年来,音频-语言领域的多模态学习取得了显著进展。然而,音频-语言学习面临数据有限且质量较低的挑战,尤其在与图像-语言任务相比。现有音频-语言数据集规模较小,手动标注受限于需完整聆听音频片段以获得准确标签。我们的方法通过系统性地对音频片段进行增广,生成包含自然语言标签及相应音频信号处理操作的音频-描述配对。运用大语言模型,我们使用提示模板生成增广后音频片段的描述。这种可扩展的方法构建了 AudioSetMix 数据集,作为文本与音频相关模型的高质量训练数据。我们的数据集集成后可提升模型在多个基准测试上的性能,提供更丰富且更精准对齐的样本。值得注意的是,我们的数据集弥补了现有数据集中缺失修饰词(形容词和副词)的不足。通过使模型学习这些概念,并在训练期生成硬负例,我们在多个基准测试上实现了最新性能。
引用
@article{arxiv.2405.11093,
title = {AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations},
author = {David Xu},
journal= {arXiv preprint arXiv:2405.11093},
year = {2024}
}
备注
typos corrected