基于可听性引导的零样本音频描述生成
声音
2023-09-08 v1 计算与语言
音频与语音处理
摘要
音频描述生成任务本质上类似于图像和视频描述生成等任务,但其受到的关注少得多。我们提出音频描述生成的三个期望性质——(i)生成文本的流畅性,(ii)生成文本对输入音频的忠实性,以及与之相关的(iii)可听性,即仅基于音频便可被感知的质量。我们的方法是一种零样本方法,即我们不学习执行描述生成;相反,描述生成作为一个推理过程发生,涉及三个对应于三种期望性质的网络:(i)一个大语言模型,出于便利我们采用 GPT-2,(ii)一个提供音频文件与文本之间匹配分数的模型,为此我们使用称为 ImageBind 的多模态匹配网络,(iii)一个文本分类器,使用我们通过指示 GPT-4 以旨在引导生成可听与不可听句子的提示自动收集的数据集训练。我们在 AudioCap 数据集上展示结果,表明可听性引导相比缺乏该目标的基线显著提升了性能。
引用
@article{arxiv.2309.03884,
title = {Zero-Shot Audio Captioning via Audibility Guidance},
author = {Tal Shaharabany and Ariel Shaulov and Lior Wolf},
journal= {arXiv preprint arXiv:2309.03884},
year = {2023}
}