中文

基于DAMI-P2C亲子多模态交互数据集的双人语音情感识别

音频与语音处理 2020-08-24 v1 计算与语言 声音

摘要

双人对话中基于语音的自动个体情感识别是一项具有挑战性的任务,部分原因在于其对人工预处理的严重依赖。传统方法常需要手工提取语音特征并分割说话人轮次。本工作中,我们设计端到端深度学习方法,以识别含两名说话人的音频流中每人的情感表达,自动发现与目标说话人情感相关的特征和时间区域。我们将局部注意力机制集成到端到端架构中,并比较三种注意力实现——一种均值池化和两种加权池化方法——的性能。结果表明,所提加权池化注意力方案能够学会聚焦于含目标说话人情感信息的区域,并成功提取个体的效价和唤醒强度。本文引入并使用了一项“多模态交互中的双人情感——亲子”(DAMI-P2C)数据集,该数据集在一项34个家庭的研究中采集,其中一名家长与一名儿童(3-7岁)共同阅读故事书。与现有公开情感识别数据集不同,DAMI-P2C数据集中两名说话人的每个实例均由三名标注者标注感知情感。为鼓励对多说话人情感感知这一挑战性任务的更多研究,我们公开了标注的DAMI-P2C数据集,包括双人原始音频的声学特征、情感标注以及每个双人组合多样的发展、社会和人口统计学档案。

关键词

引用

@article{arxiv.2008.09207,
  title  = {Dyadic Speech-based Affect Recognition using DAMI-P2C Parent-child Multimodal Interaction Dataset},
  author = {Huili Chen and Yue Zhang and Felix Weninger and Rosalind Picard and Cynthia Breazeal and Hae Won Park},
  journal= {arXiv preprint arXiv:2008.09207},
  year   = {2020}
}

备注

Accepted by the 2020 International Conference on Multimodal Interaction (ICMI'20)