基于图卷积网络与强化学习的对话代理上下文实时多模态情绪识别
计算与语言
2023-10-31 v1 人机交互
机器学习
摘要
由于生成式人工智能(GenAI)和大语言模型(LLM)的最新发展,对话代理正变得越来越流行和被接受。它们通过以我们熟悉的方式互动并作为虚拟伴侣提供支持,从而带来人性化的体验。因此,理解用户情绪以做出体贴回应十分重要。与标准情绪识别问题相比,对话代理面临必须实时识别的额外约束。使用音频、视觉和文本模态的模型架构研究主要集中于使用不提供在线特征的全视频序列进行情绪分类。在这项工作中,我们提出了一种使用图卷积网络与强化学习(conER-GRL)的上下文情绪识别新范式。对话被划分为较小的语句组,以有效提取上下文信息。系统使用门控循环单元(GRU)从这些语句组中提取多模态特征。更重要的是,图卷积网络(GCN)和强化学习(RL)代理被级联训练,以捕捉交互场景中情绪特征的复杂依赖关系。在基准数据集 IEMOCAP 上将 conER-GRL 模型与其他最先进模型比较,展示了 conER-GRL 架构在从多模态对话信号实时识别情绪方面的优势能力。
引用
@article{arxiv.2310.18363,
title = {A Contextualized Real-Time Multimodal Emotion Recognition for Conversational Agents using Graph Convolutional Networks in Reinforcement Learning},
author = {Fathima Abdul Rahman and Guang Lu},
journal= {arXiv preprint arXiv:2310.18363},
year = {2023}
}
备注
5 pages (4 main + 1 reference), 2 figures. Submitted to IEEE FG2024