中文

基于音频-语言模型引导与音频上下文关键词的零样本音频字幕生成

音频与语音处理 2023-11-15 v1 人工智能 计算与语言 声音

摘要

零样本音频字幕旨在无需针对该任务的先验训练,自动为音频内容生成描述性文本字幕。与将含口语的音频内容转写为文本的语言识别不同,音频字幕通常关注环境声或人执行动作产生的声音。受零样本图像字幕方法启发,我们提出 ZerAuCap,一种无需特定任务训练即可用文本字幕概括此类通用音频信号的新型框架。具体而言,我们的框架利用预训练大语言模型(LLM)生成文本,并由预训练音频-语言模型引导以产生描述音频内容的字幕。此外,我们使用音频上下文关键词提示语言模型生成与声音广泛相关的文本。我们所提框架在 AudioCaps 与 Clotho 数据集上的零样本音频字幕中取得了最先进的结果。我们的代码可在 https://github.com/ExplainableML/ZerAuCap 获取。

关键词

引用

@article{arxiv.2311.08396,
  title  = {Zero-shot audio captioning with audio-language model guidance and audio context keywords},
  author = {Leonard Salewski and Stefan Fauth and A. Sophia Koepke and Zeynep Akata},
  journal= {arXiv preprint arXiv:2311.08396},
  year   = {2023}
}

备注

NeurIPS 2023 - Machine Learning for Audio Workshop (Oral)