通过语义扩展实现音频语言模型的可泛化提示调优
声音
2026-04-21 v2 人工智能
音频与语音处理
摘要
提示调优在视觉语言模型中取得了显著进展,近期开始用于音频语言模型(ALMs)。然而,其在ALMs中的泛化能力仍 largely 未被探索。我们观察到,传统的ALMs提示调优也存在Base-New权衡问题,进而识别出此问题源于嵌入空间语义结构的被破坏。为解决此问题,我们提出了语义扩展提示调优(SEPT)——一种通过纳入大语言模型生成的语义邻居显式正则化提示嵌入空间的即插即用框架。SEPT引入了带边际约束的新型语义扩展损失,以促进类内紧凑性和类间可分离性,从而增强提示嵌入空间的语义结构。为进行全面评估,我们建立了音频语言模型提示泛化的首个基准设置,涵盖base-to-new泛化和跨数据集可迁移性。大量实验表明,SEPT在多种提示调优基线上均能持续提升泛化性能,而在推理期间保持计算成本。
引用
@article{arxiv.2601.20867,
title = {Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion},
author = {Jaehyuk Jang and Wonjun Lee and Kangwook Ko and Changick Kim},
journal= {arXiv preprint arXiv:2601.20867},
year = {2026}
}
备注
ACL 2026 findings