语音情感识别的测试时适应
音频与语音处理
2026-01-26 v1 机器学习
声音
摘要
语音情感识别(Speech Emotion Recognition, SER)系统的实际效用受到其对领域偏移(如说话人差异、 acted 与自然化情绪的区分以及跨语料库变化)脆弱性的制约。虽然领域适应和微调广泛受到研究,但它们需要源数据或标记的目标数据,而这些数据在 SER 场景中往往不可得或引发隐私顾虑。测试时适应(Test-Time Adaptation, TTA)填补了这一鸿沟,通过仅使用无标记目标数据在推理阶段适应模型。然而,由于 TTA 主要为图像分类和语音识别所设计,针对 SER 独特领域偏移的有效性尚未被系统调查。本文对 11 种 TTA 方法在三个代表性 SER 任务上的系统评估和比较首次呈现。结果表明,无需反向传播的 TTA 方法最具前景。相反,熵最小化和伪标签方法通常会失败,因为其核心假设——单一、确定的真实标签——与情绪表达固有的模糊性不兼容。进一步地,没有单一方法在所有情况下都表现出色,其有效性高度取决于分布偏移和具体任务。
引用
@article{arxiv.2601.16240,
title = {Test-Time Adaptation for Speech Emotion Recognition},
author = {Jiaheng Dong and Hong Jia and Ting Dang},
journal= {arXiv preprint arXiv:2601.16240},
year = {2026}
}
备注
Accepted by 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)