利用软提示与硬提示的零样本音频字幕生成
声音
2024-06-11 v1 音频与语音处理
摘要
在传统的音频字幕生成方法中,模型通常使用包含音频-文本对的人工标注数据集以完全监督的方式进行训练,然后在同一数据集的测试集上进行评估。此类方法有两个局限性。首先,这些方法通常需要大量数据,并需要耗时且昂贵的人工标注来获取音频-文本对。其次,这些模型在跨域场景中通常会出现性能下降,即当输入音频来自与训练集不同的域时,然而这一点却鲜受关注。为了解决这些问题,我们提出了一种基于对比语言-音频预训练(CLAP)模型的有效音频字幕生成方法。我们提出的方法仅需文本数据进行训练,使模型能够在跨模态语义空间中根据文本特征生成文本。在推理阶段,模型利用 CLAP 的音频-文本对齐,通过音频特征为给定音频生成描述性文本。我们设计了两种策略来缓解文本与音频嵌入之间的差异:基于混合增强的软提示和基于检索的声学感知硬提示。这些方法旨在增强所提出模型的泛化性能,促使模型更稳健、更准确地生成字幕。在 AudioCaps 和 Clotho 基准上的大量实验表明了我们提出方法的有效性,其在域内场景下的表现优于其他零样本音频字幕生成方法,并在跨域场景下优于所比较的方法,凸显了我们方法的泛化能力。
引用
@article{arxiv.2406.06295,
title = {Zero-Shot Audio Captioning Using Soft and Hard Prompts},
author = {Yiming Zhang and Xuenan Xu and Ruoyi Du and Haohe Liu and Yuan Dong and Zheng-Hua Tan and Wenwu Wang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2406.06295},
year = {2024}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing