联合对齐与预测连续情感标注
机器学习
2019-07-22 v2 人机交互
音频与语音处理
机器学习
摘要
情感的时连续维度化描述(例如唤醒度、效价)使研究者能够刻画短时变化并捕捉情感表达中的长期趋势。然而,由于人类评估中固有的反应时间延迟,连续情感标签通常与输入语音信号不同步。为应对这一挑战,我们引入一种新的卷积神经网络(多延迟 sinc 网络),能够端到端地同时对齐并预测标签。所提出的网络是一堆卷积层后接一个对齐网络,该对齐网络对齐语音信号与情感标签。该网络使用我们引入的新卷积层——延迟 sinc 层实现。它是一个时移低通(sinc)滤波器,使用基于梯度的算法学习单一延迟。多个延迟 sinc 层可用于补偿作为声学空间函数的非平稳延迟。我们在两个常见情感数据集 RECOLA 和 SEWA 上测试了该系统的效能,并表明该方法在学习时变延迟的同时预测情感维度描述符,取得了最先进的仅语音结果。
引用
@article{arxiv.1907.03050,
title = {Jointly Aligning and Predicting Continuous Emotion Annotations},
author = {Soheil Khorram and Melvin G McInnis and Emily Mower Provost},
journal= {arXiv preprint arXiv:1907.03050},
year = {2019}
}
备注
IEEE Transactions on Affective Computing