中文

基于自关系注意力与时间感知的发声爆发情绪识别

声音 2022-09-27 v2 机器学习 音频与语音处理

摘要

本技术报告介绍了我们针对2022年ACII情感发声爆发(A-VB)研讨会暨竞赛中高维情绪任务(A-VB High)的情绪识别流程。我们提出的方法包含三个阶段。首先,我们通过自监督学习方法从原始音频信号及其梅尔频谱图中提取潜在特征。然后,来自原始信号的特征被送入自关系注意力与时间感知(SA-TA)模块,以学习这些潜在特征之间的有价值信息。最后,我们拼接所有特征并利用全连接层预测每种情绪的分数。经实证实验,我们提出的方法在测试集上取得了0.7295的平均一致性相关系数(CCC),而基线模型为0.5686。我们的方法代码可在 https://github.com/linhtd812/A-VB2022 获取。

关键词

引用

@article{arxiv.2209.07629,
  title  = {Self-Relation Attention and Temporal Awareness for Emotion Recognition via Vocal Burst},
  author = {Dang-Linh Trinh and Minh-Cong Vo and Guee-Sang Lee},
  journal= {arXiv preprint arXiv:2209.07629},
  year   = {2022}
}