情感识别对话的基线多模态方法
计算与语言
2026-02-03 v1 人工智能
计算机与社会
声音
音频与语音处理
摘要
我们提出了一种轻量级的多模态基线方法,用于情感识别,对话数据来自SemEval-2024 Task 3数据集,源自喜剧电视剧《朋友们》(Friends)。本报告的目标并非提出新型的领先方法,而是记录一个易于访问的参考实现,该实现结合了(i)基于变换器的文本分类器和(ii)自监督语音表示模型,采用简单的后期融合集成。我们报告基线设置和在有限训练协议下获得的实验结果,突出显示了多模态融合在单模态模型之上是否提升。本预印本提供透明度,支持未来的更严格比较。
引用
@article{arxiv.2602.00914,
title = {A Baseline Multimodal Approach to Emotion Recognition in Conversations},
author = {Víctor Yeste and Rodrigo Rivas-Arévalo},
journal= {arXiv preprint arXiv:2602.00914},
year = {2026}
}
备注
10 pages