SLAM-AAC:利用大语言模型中的 paraphrasing augmentation 和 CLAP-Refine 增强音频描述
音频与语音处理
2024-10-15 v1 声音
摘要
自动音频描述 (AAC) 旨在为输入音频信号生成自然的文本描述。近期在音频预训练模型和大语言模型 (LLM) 方面的进展显著提升了音频理解和文本推理能力,使得 AAC 取得进展成为可能。本文提出了 SLAM-AAC 通过大语言模型实现 paraphrasing augmentation 和 CLAP-Refine 以进一步提升 AAC。我们的方法使用自监督 EAT 模型提取细粒度的音频表征,然后通过轻量级线性层与文本嵌入对齐。caption 生成的 LLM 通过 LoRA adapter 高效微调。drawing inspiration from 机器翻译中的 back-translation 方法,我们在预训练期间实现 paraphrasing augmentation 以扩充 Clotho 数据集。此策略有助于缓解稀缺音频-文本对的限制,并从小型音频片段集合中生成更具多样性的描述。在推断阶段,我们引入 plug-and-play CLAP-Refine 策略充分利用多个解码输出,类似于语音识别中的 n-best rescoring 策略。使用 CLAP 模型进行音频-文本相似度计算,我们能够选择与输入音频最匹配的多个搜索束生成的文本描述。实验结果表明,SLAM-AAC 在 Clotho V2 和 AudioCaps 上实现了最先进的性能,超越了以往主流模型。
引用
@article{arxiv.2410.09503,
title = {SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs},
author = {Wenxi Chen and Ziyang Ma and Xiquan Li and Xuenan Xu and Yuzhe Liang and Zhisheng Zheng and Kai Yu and Xie Chen},
journal= {arXiv preprint arXiv:2410.09503},
year = {2024}
}