中文

PALM:面向音频语言模型的少样本提示学习

声音 2024-10-01 v1 人工智能 音频与语音处理

摘要

音频-语言模型(ALMs)最近在零样体音频识别任务中取得了显著成功,通过匹配音频波形的特征与类别特定文本提示特征来实现,灵感来自视觉-语言模型(VLMs)的进展。鉴于零样体性能对手工文本提示选择的敏感性,许多提示学习技术已为 VLMs 开发。我们探索了这些方法在 ALMs 中的有效性,并提出一种新方法:音频语言模型的提示学习(PALM),该方法优化文本编码器分支的特征空间。不同于现有方法在输入空间中工作,我们的方法在训练效率方面具有更大的优势。在 11 个音频识别数据集上 demonstration了我们方法的有效性,涵盖多种语音处理任务,并在少样本学习设置下与三个基线方法进行比较。我们的 method 在计算需求更低的情况下,既与其他方法持平,又超越其他方法。代码已在 https://asif-hanif.github.io/palm/ 上提供。

关键词

引用

@article{arxiv.2409.19806,
  title  = {PALM: Few-Shot Prompt Learning for Audio Language Models},
  author = {Asif Hanif and Maha Tufail Agro and Mohammad Areeb Qazi and Hanan Aldarmaki},
  journal= {arXiv preprint arXiv:2409.19806},
  year   = {2024}
}

备注

EMNLP 2024 (Main)