音频-语言场景与事件数据集综述
声音
2025-02-10 v2 音频与语音处理
摘要
音频-语言模型(ALMs)生成描述声音产生事件和场景的语言描述。随着数据集创建和计算资源的进步,该领域取得了显著进展。本文调查了用于训练ALMs的69个数据集,涵盖截至2024年9月的研究(https://github.com/GLJS/audio-datasets)。提供对数据集来源、音频和语言特征以及用例的全面分析。关键数据集包括基于YouTube的数据集如AudioSet,拥有超过200万样本,以及社区平台如Freesound,拥有超过100万样本。通过对音频和文本嵌入的主成分分析,评估了跨数据集的声学和语言变异性。还分析了通过CLAP嵌入的数据泄露情况,并检查了声音类别分布以识别不平衡性。最后,本次调查确定了在开发大型、多样化数据集以提升ALMs性能方面的关键挑战,包括数据集重叠、偏见、可访问性障碍以及英语内容的占主导地位,同时指出了改进的机遇。
引用
@article{arxiv.2407.06947,
title = {Audio-Language Datasets of Scenes and Events: A Survey},
author = {Gijs Wijngaard and Elia Formisano and Michele Esposito and Michel Dumontier},
journal= {arXiv preprint arXiv:2407.06947},
year = {2025}
}