中文

探索自监督学习与分类器链在非言语发声情感识别中的有效性

声音 2022-06-23 v1 音频与语音处理

摘要

我们提出了一个提交至 ICML 2022 表现力发声竞赛 ExVo Few-Shot 赛道、面向非言语发声(NV)的情感识别系统。所提方法使用自监督学习(SSL)模型从 NV 中提取特征,并利用分类器链对情感间的标签依赖进行建模。实验结果表明,与若干基线方法相比,所提方法能显著提升该任务的性能。我们提出的方法在验证集上获得 0.7250.725 的平均一致性相关系数(CCC),在测试集上获得 0.7390.739,而最佳基线方法在验证集上仅获得 0.5540.554。我们在 https://github.com/Aria-K-Alethia/ExVo 公开了代码,以帮助他人复现我们的实验结果。

关键词

引用

@article{arxiv.2206.10695,
  title  = {Exploring the Effectiveness of Self-supervised Learning and Classifier Chains in Emotion Recognition of Nonverbal Vocalizations},
  author = {Detai Xin and Shinnosuke Takamichi and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2206.10695},
  year   = {2022}
}

备注

Accepted by the ICML Expressive Vocalizations Workshop and Competition 2022