手语对话中的情感识别
计算与语言
2026-05-25 v1
摘要
情感识别是情感计算的核心组成部分,而当前手语情感数据集主要聚焦于孤立句子,缺乏对话情境。仅基于这些孤立语句训练的模型在实际场景中表现下降,因为无法利用历史对话流程。为此,我们引入情感识别到手语视频分析任务中,提出 eJSL Dialog 数据集。该数据集基于 STUDIES 语料库中的剧本构建,包含 1,920 条视频样本,组织为 480 组独特对话。我们使用从孤立视觉网络到多模态对话架构的模型,对该数据集进行系统性基准测试。结果显示,通用多模态对话情感识别模型在手语领域存在显著领域鸿沟。这表明针对手语的、具情境感知的视觉特征提取器是必需的,且扩大对话数据集规模以支持大规模预训练是未来研究的必要步骤。
引用
@article{arxiv.2605.23328,
title = {Emotion Recognition in Sign Language Conversation},
author = {Yusong Wang and Keyu Mao and Takao Obi and Minghao Shao and Kotaro Funakoshi},
journal= {arXiv preprint arXiv:2605.23328},
year = {2026}
}