用于随时间预测听者共情响应的多模态 LSTM
计算与语言
2019-01-30 v2
摘要
人们自然会理解周围人的情绪,并且常常也会与之共情。在本文中,我们预测共情听者在聆听说话者讲述生活故事时随时间变化的情绪效价。我们使用由 OMG-Empathy Prediction Challenge(与 IEEE FG 2019 联合举办的研讨会)提供的数据集。我们提出一个具有特征级融合与局部注意力的多模态 LSTM 模型,该模型从音频、文本和视觉特征预测共情响应。我们表现最佳的模型仅使用了音频和文本特征,在验证集上于 Generalized 和 Personalized 赛道分别取得了 0.29 和 0.32 的一致性相关系数(CCC),并在留出测试集上取得了 0.14 和 0.14 的 CCC。我们讨论了应对该挑战所面临的困难与汲取的经验。
引用
@article{arxiv.1812.04891,
title = {A Multimodal LSTM for Predicting Listener Empathic Responses Over Time},
author = {Zhi-Xuan Tan and Arushi Goel and Thanh-Son Nguyen and Desmond C. Ong},
journal= {arXiv preprint arXiv:1812.04891},
year = {2019}
}