中文

Odyssey情感识别挑战任务1第一名解决方案:应对类别不平衡问题

音频与语音处理 2024-05-31 v1 声音

摘要

语音情感识别是一项具有挑战性的自然情感语音分类任务,特别是在训练和测试数据中情感类型的分布不平衡时。在这种情况下,模型更难学会分离少数类,导致这些类有时被忽略或频繁误分类。先前的工作使用了类加权损失进行训练,但问题仍然存在,因为它有时会导致对少数类的过拟合或对多数类的欠拟合。本文介绍了由多站点团队开发的参与Odyssey 2024情感识别挑战Track-1的系统。挑战数据具有上述特性,因此所提出的系统旨在通过在使用类加权损失时引入焦点损失进行优化来解决这些问题。具体来说,焦点损失进一步由基于先验的类权重加权。实验结果表明,结合这两种方法通过牺牲多数类的性能带来了更好的整体性能。该系统进一步采用多数投票策略来组合7个模型集成体的输出。这些模型独立训练,使用不同的声学特征和损失函数——旨在对不同数据具有不同特性。因此,这些模型在多数类和少数类上表现出不同的性能偏好。集成系统输出在挑战中获得了最佳性能,在68个提交中排名第一。它也优于我们集合中的所有单一模型。在Odyssey 2024情感识别挑战Task-1数据上,该系统获得了35.69%的Macro-F1分数和37.32%的准确率。

关键词

引用

@article{arxiv.2405.20064,
  title  = {1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem},
  author = {Mingjie Chen and Hezhao Zhang and Yuanchao Li and Jiachen Luo and Wen Wu and Ziyang Ma and Peter Bell and Catherine Lai and Joshua Reiss and Lin Wang and Philip C. Woodland and Xie Chen and Huy Phan and Thomas Hain},
  journal= {arXiv preprint arXiv:2405.20064},
  year   = {2024}
}