E-THER:面向同情 AI 的多模态数据集——致情意识
人机交互
2025-09-09 v2 计算与语言
摘要
当前同情 AI 系统的一个常见不足是无法识别言语表达是否完全反映其内在情感状态。这是由于现有数据集在培训这些系统时,仅关注面向情感识别的浅层特征,而未解决有助于同情理解的言语-视觉不一致(mismatch)模式。本文提出 E-THER,首个基于以人为中心的治疗(Person-Centered Therapy) grounded 的多模态数据集,包含用于言语-视觉不一致检测的多维注释,使 AI 系统能够获得真正而非僵化的同情能力。数据集中的注释来源于人本主义方法,即识别治疗师-来访者互动中言语-视觉情感错位,形成用于培训和评估 AI 在同情任务上的框架。此外,额外的参与度评分提供了用于研究应用的行为注释。在基于同情和治疗原则的评估指标下,对最新视觉语言模型(如 IDEFICS 和 VideoLLAVA)进行测试,观察到同情性和治疗性对话质量显著提升。实证发现表明,经不一致训练的模型在关键特征(如维持治疗性参与度、最小化人工或夸大语言模式、保持对 PCT 理论框架的忠实度)方面均优于通用模型。
引用
@article{arxiv.2509.02100,
title = {E-THER: A Multimodal Dataset for Empathic AI -- Towards Emotional Mismatch Awareness},
author = {Sharjeel Tahir and Judith Johnson and Jumana Abu-Khalaf and Syed Afaq Ali Shah},
journal= {arXiv preprint arXiv:2509.02100},
year = {2025}
}
备注
15 pages, 4 figures. Preprint