MI-Fuse:面向无监督领域自适应的标签融合框架——结合闭源大音频语言模型
计算与语言
2025-09-26 v1 声音
音频与语音处理
摘要
大音频语言模型(LALM)在语音任务上展现出强大的零样本能力,表明其在语音情感识别(SER)中具有潜力。然而,真实部署中的 SER 往往因领域不匹配而失效,此时源域数据不可用且强大的 LALM 仅能通过 API 访问。我们提出问题:给定仅无标签的目标域音频和仅可通过 API 访问的 LALM,能否训练一个学生模型在目标域中超越 LALM?为此,我们提出 MI-Fuse——一种去噪标签融合框架,通过引入源域训练的 SER 分类器作为辅助教师来补充 LALM。该框架从两位教师处获取多个随机预测,以基于互信息的不确定性对其均值分布加权,并通过指数移动平均教师稳定训练。在三个公开情感数据集和六次跨域迁移上的实验表明,该方法持续取得增益,学生模型超越了 LALM 并比最强基线高出 3.9%。该方法在不共享源域数据的前提下增强了情感感知语音系统,实现了真实的领域自适应。
引用
@article{arxiv.2509.20706,
title = {MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model},
author = {Hsiao-Ying Huang and Yi-Cheng Lin and Hung-yi Lee},
journal= {arXiv preprint arXiv:2509.20706},
year = {2025}
}
备注
5 pages, 2 figures, 2 tables