ACII 2022 情感发声工作坊与竞赛:理解一种被严重低估的情感表达模态
音频与语音处理
2022-10-31 v2 人工智能
声音
摘要
ACII 情感发声工作坊与竞赛致力于理解发声(vocal bursts)的多种情感维度:笑声、倒吸气声、哭声、尖叫声,以及许多其他对情感表达和更广义上的人类交流至关重要的非语言发声。今年的竞赛包含四个赛道,使用来自 1,702 名说话人的 59,299 条大规模真实场景(in-the-wild)发声数据集。第一项 A-VB-High 任务要求参赛者针对一种新颖的情感模型进行多标签回归,利用十类丰富标注的情感表达强度,包括敬畏、恐惧和惊讶。第二项 A-VB-Two 任务使用更传统的二维情感模型,即唤醒度(arousal)和效价(valence)。第三项 A-VB-Culture 任务要求参赛者探索数据集的文化方面,训练依赖于本国的模型。最后,第四项 A-VB-Type 任务要求参赛者将发声类型(如笑声、哭声、咕哝声)识别为八类分类问题。本文描述了这四个赛道及使用最先进机器学习方法的基线系统。各赛道的基线性能通过端到端深度学习模型获得,如下:A-VB-High 获得十维平均一致性相关系数(Concordance Correlation Coefficient, CCC)为 0.5687 CCC;A-VB-Two 获得二维平均 CCC 为 0.5084;A-VB-Culture 获得四种文化的平均 CCC 为 0.4401;A-VB-Type 的八类基线非加权平均召回率(Unweighted Average Recall, UAR)为 0.4172 UAR。
引用
@article{arxiv.2207.03572,
title = {The ACII 2022 Affective Vocal Bursts Workshop & Competition: Understanding a critically understudied modality of emotional expression},
author = {Alice Baird and Panagiotis Tzirakis and Jeffrey A. Brooks and Christopher B. Gregory and Björn Schuller and Anton Batliner and Dacher Keltner and Alan Cowen},
journal= {arXiv preprint arXiv:2207.03572},
year = {2022}
}