音频-语言模型中用于语音情感识别的提示放大与零样本晚期融合
音频与语音处理
2026-03-25 v1 机器学习
摘要
音频-语言模型(ALM)在理解语音和非语音音频方面取得了进展。然而,领域专家基础模型(FMs)在语音处理封闭式任务(如语音情感识别 SER)中仍然表现最佳。使用 ALM 进行零样本 SER 是一个流行选择,但其与专家模型协作以达到最先进的(SOTA)性能的潜力尚未被探索。我们提出了 ZS-Fuse,一种晚期融合方法,将双编码器 ALM 的零样本情感估计与专家 FMs 相结合。为处理情感模糊性和提示选择的敏感性,1)我们使用了简单的提示集成,2)提出了一种称为提示放大的新技术,通过重复音频和文本查询来发现更强的零样本能力。我们通过使用三个双编码器 ALM 和两个 FMs 评估 ZS-Fuse 的有效性,并在三个语音情感识别数据集上报告了对 SOTA 基线(如 WavLM-Large)的改进。
引用
@article{arxiv.2603.23057,
title = {Prompt Amplification and Zero-Shot Late Fusion in Audio-Language Models for Speech Emotion Recognition},
author = {Saurabh Kataria and Xiao Hu},
journal= {arXiv preprint arXiv:2603.23057},
year = {2026}
}