TelME:面向对话情感识别的教师主导多模态融合网络
计算与语言
2024-04-02 v2 机器学习
声音
音频与语音处理
摘要
对话情感识别(ERC)对于使对话系统能够有效响应用户请求起着至关重要的作用。对话中的情感可以通过音频、视觉和文本等多种模态的表征来识别。然而,由于非语言模态对情感识别的贡献较弱,多模态ERC一直被认为是一项具有挑战性的任务。在本文中,我们提出了面向ERC的教师主导多模态融合网络(TelME)。TelME结合了跨模态知识蒸馏,将作为教师的语言模型中的信息传递给非语言学生模型,从而优化弱模态的效能。然后,我们使用一种学生网络支持教师的移位融合方法,将多模态特征结合起来。TelME在MELD(一个用于ERC的多说话人对话数据集)上取得了最先进的性能。最后,我们通过额外的实验证明了我们各组成部分的有效性。
引用
@article{arxiv.2401.12987,
title = {TelME: Teacher-leading Multimodal Fusion Network for Emotion Recognition in Conversation},
author = {Taeyang Yun and Hyunkuk Lim and Jeonghwan Lee and Min Song},
journal= {arXiv preprint arXiv:2401.12987},
year = {2024}
}
备注
NAACL 2024 main conference