消除类别不平衡:情感意图联合理解挑战的 Fosafer 系统
声音
2025-08-18 v1 音频与语音处理
摘要
本文提出了 Fosafer 方法,用于多模态情感意图联合理解挑战中的 Track 2 普通话项目,该项目旨在尽管类别不平衡问题,实现对普通话情感和意图的联合识别。为缓解此问题,我们在文本、视频和音频等模态上采用多种数据增强技术。此外,我们引入了样本加权 Focal 对比损失,旨在解决识别少数类样本以及语义相似但难以区分的样本的挑战。我们对 Hubert 模型进行微调,以适应情感意图联合识别。为缓解模态间竞争,我们引入了模态 dropout 策略。最终预测采用多数投票方式确定结果。实验结果表明,我们的方法有效,达到了 Track 2 普通话挑战中第二名的成绩。
引用
@article{arxiv.2508.11362,
title = {Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge},
author = {Honghong Wang and Yankai Wang and Dejun Zhang and Jing Deng and Rong Zheng},
journal= {arXiv preprint arXiv:2508.11362},
year = {2025}
}
备注
2 pages. pubilshed by ICASSP2025