谁的情感更重要?无先验知识的语音活动定位
音频与语音处理
2023-08-16 v4 计算机视觉与模式识别
机器学习
神经与进化计算
声音
摘要
对话中的情感识别(ERC)任务受益于多模态数据的可用性,例如基于视频的 Multimodal EmotionLines Dataset (MELD) 所提供的数据。然而,仅有少数研究方法同时使用 MELD 视频中的声学和视觉信息。原因有二:首先,MELD 中的标签到视频对齐存在噪声,使得这些视频成为不可靠的情感语音数据源。其次,同一场景中的对话可能涉及多人,这需要对话语来源进行定位。在本文中,我们通过使用近期的主动说话者检测和自动语音识别模型,引入了通过重新对齐获得固定视听信息的 MELD (MELD-FAIR)。我们能够重新对齐 MELD 的视频,并在 MELD 提供的 96.92% 的话语中捕捉到说话者的面部表情。使用自监督语音识别模型的实验表明,重新对齐的 MELD-FAIR 视频与 MELD 数据集中给定的话语转录更紧密地匹配。最后,我们设计了一个在重新对齐的 MELD-FAIR 视频上训练的对话情感识别模型,其性能优于基于纯视觉的最先进 ERC 模型。这表明,定位语音活动的来源确实有助于从说话者中提取面部表情,并且人脸提供了比现有最先进模型迄今为止使用的视觉特征更具信息量的视觉线索。MELD-FAIR 的重新对齐数据,以及重新对齐过程和情感识别的代码可在 https://github.com/knowledgetechnologyuhh/MELD-FAIR 获取。
引用
@article{arxiv.2211.15377,
title = {Whose Emotion Matters? Speaking Activity Localisation without Prior Knowledge},
author = {Hugo Carneiro and Cornelius Weber and Stefan Wermter},
journal= {arXiv preprint arXiv:2211.15377},
year = {2023}
}
备注
17 pages, 8 figures, 7 tables, Published in Neurocomputing