中文

AQUALLM:使用大型语言模型的音频问答数据生成

计算与语言 2024-01-01 v1 人工智能 机器学习 多媒体 声音 音频与语音处理

摘要

音频问答(AQA)是一项关键任务,其中机器分析音频信号和自然语言问题以产生精确的自然语言答案。在追求AQA系统精度时,拥有高质量、多样化和大规模的AQA数据集的重要性不言而喻。尽管在开发准确高效的AQA模型方面受到了显著关注,但针对特定任务创建高质量、多样化和大规模的数据集并未引起足够重视。为了解决这一挑战,本文做出了若干贡献。我们引入了一个可扩展的AQA数据生成流水线,称为AQUALLM框架,该框架依赖于大型语言模型(LLM)。该框架利用现有的音频-字幕注释,并结合最先进的LLM来生成大规模、高质量的AQA数据集。此外,我们提供了三个大规模、高质量的AQA基准数据集,为AQA研究的进展做出了重要贡献。在提出的数据集上训练的AQA模型相比现有最先进模型设立了更优的基准。此外,与使用人工标注的AQA数据训练的模型相比,在我们的数据集上训练的模型表现出更强的泛化能力。代码和数据集将在GitHub上提供。

关键词

引用

@article{arxiv.2312.17343,
  title  = {AQUALLM: Audio Question Answering Data Generation Using Large Language Models},
  author = {Swarup Ranjan Behera and Krishna Mohan Injeti and Jaya Sai Kiran Patibandla and Praveen Kumar Pokala and Balakrishna Reddy Pailla},
  journal= {arXiv preprint arXiv:2312.17343},
  year   = {2024}
}