中文

Audio Dialogues:用于音频和音乐理解的多轮对话数据集

计算与语言 2024-04-12 v1 声音 音频与语音处理

摘要

现有的音频理解数据集主要集中于单轮交互(如音频字幕生成、音频问答),用于描述自然语言中的音频,从而限制了通过交互式对话理解音频的能力。为弥补这一空白,我们引入了Audio Dialogues:一个包含163k个样本的多轮对话数据集,涵盖一般音频声音和音乐。除了对话外,Audio Dialogues还包含问答对,用于理解和比较多个输入音频。Audio Dialogues利用基于提示的方法和现有数据集中的字幕注释,使用大语言模型(LLM)生成多轮对话。我们在我们提出的数据集上评估了现有的音频增强大语言模型,以展示Audio Dialogues的复杂性和适用性。我们用于生成数据集的代码将公开提供。详细的提示和生成的对话可在演示网站 https://audiodialogues.github.io/ 上找到。

关键词

引用

@article{arxiv.2404.07616,
  title  = {Audio Dialogues: Dialogues dataset for audio and music understanding},
  author = {Arushi Goel and Zhifeng Kong and Rafael Valle and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2404.07616},
  year   = {2024}
}

备注

Demo website: https://audiodialogues.github.io/