中文

AudioSetCaps:基于大型音频与语言模型的自动化生成管道构建的丰富音频-字 captions 数据集

音频与语音处理 2024-12-02 v1

摘要

随着音频-语言模型的兴起,构建大规模的配对音频-语言数据集已成为模型开发中至关重要却又具有挑战性的任务,主要由于其所需的时间投入和劳动密集程度。虽然大型语言模型(LLM)已提高了合成音频字 captions 生成的效率,但当前方法在有效提取和融合详细音频信息方面存在困难。本文提出了一种自动化管道,集成音频-语言模型进行细粒度内容提取、LLM 进行合成字 captions 生成,以及基于对比语言-音频预训练(CLAP)模型的细化过程,以提高字 captions 的质量。具体而言,我们在内容提取阶段采用提示链技术获取准确且细粒度的音频信息,同时利用细化过程缓解生成字 captions 中潜在的幻觉问题。基于 AudioSet 数据集和上述方法,我们创建了 AudioSetCaps 数据集,包含 190 万个音频-字 captions 对,为撰写时所创建的最大音频-字 captions 数据集。使用 AudioSetCaps 训练的模型在音频-文本检索中实现了最新的性能,分别达到文本到音频的 R@1 分数为 46.3%,音频到文本的 R@1 分数为 59.7%,自动音频字 captions 生成的 CIDEr 分数为 84.8。鉴于上述方法在 AudioSetCaps 上的前景成果,我们创建了另一数据集,包含 410 万个合成音频-语言配对,基于 Youtube-8M 和 VGGSound 数据集。为促进音频-语言学习研究,我们已在 https://github.com/JishengBai/AudioSetCaps 上公开此管道、包含 600 万个音频-语言配对的数据集以及预训练模型。

关键词

引用

@article{arxiv.2411.18953,
  title  = {AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models},
  author = {Jisheng Bai and Haohe Liu and Mou Wang and Dongyuan Shi and Wenwu Wang and Mark D. Plumbley and Woon-Seng Gan and Jianfeng Chen},
  journal= {arXiv preprint arXiv:2411.18953},
  year   = {2024}
}