多模态对话中的生成式情感原因解释
计算与语言
2025-06-05 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
多模态对话是人类交流的重要形式,承载着丰富的情感内容,探索其中的情感原因是一项具有重要意义的研究。然而,现有关于情感原因的研究通常采用在单一文本模态中选择话语的方法来定位因果话语。这种方法仅限于粗粒度的评估,缺乏对情感因果关系的细致解释,并且在识别多模态情感触发因素方面能力不足。因此,我们引入了一项任务——多模态对话中的情感原因解释(MECEC)。该任务旨在基于对话的多模态上下文生成摘要,清晰直观地描述触发特定情感的原因。为适应这一任务,我们基于MELD数据集构建了一个新数据集(ECEM)。ECEM结合了视频片段和角色情感的详细解释,有助于探索多模态对话中情感表达的因果因素。进一步提出了一种新方法FAME-Net,利用大型语言模型(LLM)的能力来分析视觉数据,并准确解读视频中通过面部表情传达的情感。通过利用面部情感的传染效应,FAME-Net有效地捕捉了参与对话的个体的情感原因。在新构建的数据集上的实验结果表明,FAME-Net优于多个优秀的基线方法。代码和数据集可在 https://github.com/3222345200/FAME-Net 获取。
引用
@article{arxiv.2411.02430,
title = {Generative Emotion Cause Explanation in Multimodal Conversations},
author = {Lin Wang and Xiaocui Yang and Shi Feng and Daling Wang and Yifei Zhang and Zhitao Zhang},
journal= {arXiv preprint arXiv:2411.02430},
year = {2025}
}