中文

基于循环神经网络的情绪维度标注动态时间对齐

声音 2022-09-22 v1 人工智能 人机交互 音频与语音处理

摘要

大多数自动情绪识别系统利用时间连续的情感标注,以提供对真实交互中自发表达的细粒度描述。由于情绪相当主观,其标注通常由多名标注者执行,他们针对给定维度提供一条轨迹,即描述如唤醒度(arousal)或效价(valence)等维度的时续序列。然而,同一表达的标注在标注者之间很少一致,无论是在时间还是数值上,这给用于学习情绪预测模型的轨迹增加了偏差与延迟。因此我们提出一种方法,可动态补偿标注间的不一致,并使用循环神经网络将轨迹与相应声学特征同步。实验评估在多个情绪数据集上进行,这些数据集包含中国、法国、德国和匈牙利参与者,他们在无噪声条件或真实环境(in-the-wild)中远程交互。结果表明,我们的方法能显著提高标注者间一致性,以及轨迹与音频特征间的相关性,对唤醒度和效价均如此。此外,使用简单轻量模型在这些维度的自动预测上取得了改进,尤其对于无噪声条件下的效价,以及真实环境录制中的唤醒度。

关键词

引用

@article{arxiv.2209.10223,
  title  = {Dynamic Time-Alignment of Dimensional Annotations of Emotion using Recurrent Neural Networks},
  author = {Sina Alisamir and Fabien Ringeval and Francois Portet},
  journal= {arXiv preprint arXiv:2209.10223},
  year   = {2022}
}