EMO-TTA:面向语音情感识别的音频语言模型测试时适应改进
声音
2026-02-05 v2 人工智能
摘要
语音情感识别(SER)中的音频语言模型(ALMs)在测试时面临分布迁移,导致在非域场景下性能下降。测试时适应(TTA)提供了有前景的解决方案,但常依赖梯度更新或提示调优,限制了灵活性和实用性。我们提出 Emo-TTA,一个轻量级、无需训练的适应框架,通过期望最大化程序逐步更新类别条件统计量,以进行显式测试时分布估计,利用 ALM 预测作为先验。Emo-TTA 针对单个测试样本运行,不修改模型权重。在六个非域 SER 基准测试上实验结果显示, consistently 优于现有 TTA 方法,证明了统计性适应在对齐模型预测与测试分布演变方面的有效性。
引用
@article{arxiv.2509.25495,
title = {EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition},
author = {Jiacheng Shi and Hongfei Du and Y. Alicia Hong and Ye Gao},
journal= {arXiv preprint arXiv:2509.25495},
year = {2026}
}
备注
Accepted to ICASSP 2026