中文

手语对话中的情感识别

计算与语言 2026-05-25 v1

摘要

情感识别是情感计算的核心组成部分,而当前手语情感数据集主要聚焦于孤立句子,缺乏对话情境。仅基于这些孤立语句训练的模型在实际场景中表现下降,因为无法利用历史对话流程。为此,我们引入情感识别到手语视频分析任务中,提出 eJSL Dialog 数据集。该数据集基于 STUDIES 语料库中的剧本构建,包含 1,920 条视频样本,组织为 480 组独特对话。我们使用从孤立视觉网络到多模态对话架构的模型,对该数据集进行系统性基准测试。结果显示,通用多模态对话情感识别模型在手语领域存在显著领域鸿沟。这表明针对手语的、具情境感知的视觉特征提取器是必需的,且扩大对话数据集规模以支持大规模预训练是未来研究的必要步骤。

关键词

引用

@article{arxiv.2605.23328,
  title  = {Emotion Recognition in Sign Language Conversation},
  author = {Yusong Wang and Keyu Mao and Takao Obi and Minghao Shao and Kotaro Funakoshi},
  journal= {arXiv preprint arXiv:2605.23328},
  year   = {2026}
}