WavCaps:一个用于音频-语言多模态研究的 ChatGPT 辅助弱标注音频描述数据集
音频与语音处理
2024-07-22 v2 计算与语言
多媒体
声音
摘要
近年来,音频-语言(AL)多模态学习任务的进展显著。然而,由于现有音频-语言数据集收集过程昂贵且耗时,且规模有限,研究人员面临挑战。为解决这一数据稀缺问题,我们引入了 WavCaps,首个大规模弱标注音频描述数据集,包含约 40 万条带配对描述的音频片段。我们从网络来源和一个声音事件检测数据集中获取音频片段及其原始描述。然而,在线采集的原始描述噪声极大,不适合直接用于自动音频描述等任务。为克服该问题,我们提出了一个三阶段处理流程,用于过滤噪声数据并生成高质量描述,其中利用大语言模型 ChatGPT 自动过滤和转换原始描述。我们对 WavCaps 数据集的特征进行了全面分析,并在多个下游音频-语言多模态学习任务上进行了评估。在 WavCaps 上训练的系统以显著优势超越先前的最优(SOTA)模型。我们希望所提出的 WavCaps 数据集能促进音频-语言多模态研究,并展示利用 ChatGPT 增强学术研究的潜力。我们的数据集与代码见 https://github.com/XinhaoMei/WavCaps。
引用
@article{arxiv.2303.17395,
title = {WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research},
author = {Xinhao Mei and Chutong Meng and Haohe Liu and Qiuqiang Kong and Tom Ko and Chengqi Zhao and Mark D. Plumbley and Yuexian Zou and Wenwu Wang},
journal= {arXiv preprint arXiv:2303.17395},
year = {2024}
}
备注
Accepted to TASLP