M3ED:多模态多场景多标签情感对话数据库
计算与语言
2022-05-23 v1 人工智能
摘要
说话者的情绪状态在对话中会受到许多不同因素的影响,例如对话场景、对话话题和对话者刺激。然而,目前可用于支持此类对话中多模态情感分析的数据资源在规模和多样性上均有限。在这项工作中,我们提出了一个多模态多场景多标签情感对话数据集M3ED,其包含来自56部不同电视剧的990段双人情感对话,共计9,082轮和24,449条话语。M3ED在话语级别标注了7种情绪类别(高兴、惊讶、悲伤、厌恶、愤怒、恐惧和中性),并涵盖声学、视觉和文本模态。据我们所知,M3ED是首个中文多模态情感对话数据集。它对跨文化的情感分析与识别具有价值。我们在M3ED数据集上应用了几种最先进的方法来验证数据集的有效性和质量。我们还提出了一个通用的多模态对话感知交互框架MDI,用于对对话上下文建模以进行情绪识别,其在M3ED上取得了与最先进方法相当的性能。完整数据集与代码已公开。
引用
@article{arxiv.2205.10237,
title = {M3ED: Multi-modal Multi-scene Multi-label Emotional Dialogue Database},
author = {Jinming Zhao and Tenggan Zhang and Jingwen Hu and Yuchen Liu and Qin Jin and Xinchao Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2205.10237},
year = {2022}
}