Auto-ACD:用于音频-语言表示学习的大规模数据集
声音
2024-09-10 v4 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
近来,在大规模多模态数据集的驱动下,AI 社区在开发强大基础模型方面取得了重大进展。然而,对于音频表示学习,现有数据集在以下方面存在局限:数据量不足、内容简单、收集过程繁琐。为建立带有高质量描述的音频数据集,我们提出一种利用多模态输入(如视频帧、音频流)的创新自动方法。具体而言,我们构建了一个大规模、高质量音频-语言数据集,命名为 Auto-ACD,包含超过 1.5M 的音频-文本对。我们利用一系列预训练模型或 API 来确定音视频同步、生成图像描述、目标检测或针对特定视频的音频标签。随后,我们采用 LLM 在提取的多模态线索引导下,为每段音频改写一致的描述。为证明所提数据集的有效性,我们在该数据集上训练广泛使用的模型,并展示其在各种下游任务(例如音频-语言检索、音频描述、零样本分类)上的性能提升。此外,我们建立了一个带有环境信息的新型基准,并为音频-文本任务提供了基准。
引用
@article{arxiv.2309.11500,
title = {Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning},
author = {Luoyi Sun and Xuenan Xu and Mengyue Wu and Weidi Xie},
journal= {arXiv preprint arXiv:2309.11500},
year = {2024}
}
备注
Accepted by ACM MM 2024