RECAP:检索增强的音频描述生成
音频与语音处理
2024-06-07 v2 人工智能
计算与语言
声音
摘要
我们提出 RECAP(REtrieval-Augmented Audio CAPtioning,检索增强的音频描述生成),一种新颖且有效的音频描述生成系统,其根据输入音频以及从数据存储中检索到的与该音频相似的其他描述来生成描述。此外,我们提出的方法可迁移至任意领域,无需任何额外微调。为生成音频样本的描述,我们利用音频-文本模型 CLAP 从可替换的数据存储中检索与其相似的描述,随后用于构建提示。接着,我们将该提示输入 GPT-2 解码器,并在 CLAP 编码器与 GPT-2 之间引入交叉注意力层以对音频进行条件化以生成描述。在 Clotho 和 AudioCaps 两个基准数据集上的实验表明,RECAP 在域内设定下取得有竞争力的性能,在域外设定下取得显著改进。此外,由于其能够以免训练方式利用大型仅含文本描述的存储,RECAP 展现出对训练中从未见过的新型音频事件及含多事件的组合音频进行描述的独特能力。为促进该领域研究,我们还发布了 AudioSet、AudioCaps 和 Clotho 的 150,000+ 条新弱标注描述。
引用
@article{arxiv.2309.09836,
title = {RECAP: Retrieval-Augmented Audio Captioning},
author = {Sreyan Ghosh and Sonal Kumar and Chandra Kiran Reddy Evuru and Ramani Duraiswami and Dinesh Manocha},
journal= {arXiv preprint arXiv:2309.09836},
year = {2024}
}
备注
ICASSP 2024. Code and data: https://github.com/Sreyan88/RECAP