中文

情感识别对话的基线多模态方法

计算与语言 2026-02-03 v1 人工智能 计算机与社会 声音 音频与语音处理

摘要

我们提出了一种轻量级的多模态基线方法,用于情感识别,对话数据来自SemEval-2024 Task 3数据集,源自喜剧电视剧《朋友们》(Friends)。本报告的目标并非提出新型的领先方法,而是记录一个易于访问的参考实现,该实现结合了(i)基于变换器的文本分类器和(ii)自监督语音表示模型,采用简单的后期融合集成。我们报告基线设置和在有限训练协议下获得的实验结果,突出显示了多模态融合在单模态模型之上是否提升。本预印本提供透明度,支持未来的更严格比较。

关键词

引用

@article{arxiv.2602.00914,
  title  = {A Baseline Multimodal Approach to Emotion Recognition in Conversations},
  author = {Víctor Yeste and Rodrigo Rivas-Arévalo},
  journal= {arXiv preprint arXiv:2602.00914},
  year   = {2026}
}

备注

10 pages