中文

基于MAGIC增强关键词提示的CLIP模型零样本音频字幕生成

计算与语言 2025-09-17 v1

摘要

自动音频字幕生成(AAC)为音频片段生成字幕,但由于与图像字幕生成相比数据集有限,面临诸多挑战。为了克服这一问题,我们提出了一种零样本AAC系统,该系统利用预训练模型,无需进行大量训练。我们的方法使用预训练的音频CLIP模型提取听觉特征并生成结构化提示,以引导大型语言模型(LLM)生成字幕。与传统的贪心解码不同,我们的方法通过音频CLIP模型优化token选择,确保与音频内容对齐。实验结果表明,使用MAGIC搜索和WavCaps模型,NLG平均得分提高了35%(从4.7提高到7.3)。性能受音频-文本匹配模型和关键词选择的影响很大,使用单个关键词提示时取得最佳结果,而在不使用关键词列表时性能下降50%。

关键词

引用

@article{arxiv.2509.12591,
  title  = {MAGIC-Enhanced Keyword Prompting for Zero-Shot Audio Captioning with CLIP Models},
  author = {Vijay Govindarajan and Pratik Patel and Sahil Tripathi and Md Azizul Hoque and Gautam Siddharth Kashyap},
  journal= {arXiv preprint arXiv:2509.12591},
  year   = {2025}
}

备注

Accepted in The 26th International Conference on Web Information Systems Engineering (WISE), scheduled for 15-17 December 2025 in Marrakech, Morocco