中文

WELD:面向 ubiquitous 情感计算的第一个天然长期小团队职场情感数据集

人工智能 2026-05-19 v2 计算机与社会 机器学习

摘要

情感计算在实验室环境中取得了快速发展,但目前尚无数据集同时满足(i)持续数月至数年的时长、(ii)真实职场情境、(iii)稳定的小型团队社会结构以及(iv)能通过制度审查的完全被动感知协议。我们介绍的 WELD 数据集是首个满足上述全部四项条件的数据集。WELD 包含来自中国某软件公司 49 名员工在 30.1 个月(2021 年 11 月至 2024 年 5 月)期间的 733,780 帧七类面部表情概率向量——目前最长的自然场景情感语料库,也是唯一支持同一受试者内个体纵向分析与团队内关系分析的多年数据语料。数据以四级访问模型发布,仅聚合后的概率可公开下载。我们通过复现三个已建立现象(+43.1% 周末情绪提升;13:00 的日节律谷值;上海 2022 年防疫期间效应 d=-0.40),并报告四项新发现:(1)方差分解显示日情绪方差中 19.3% 归因于个体间差异,29.8% 归因于月度季节性——为未来预测模型提供量化上限;(2)隐马尔可夫分解揭示六种情绪状态下的非对称负面停留时间(16-18 天 vs 3 天);(3)留一受试者离职预测达到 AUC=0.79,但 Cox concordance index 仅为 0.52,暴露出在报告 AUC 时缺乏生存性基准的指标陷阱;(4)该数据集揭示了面向中亚人脸的即插即用情绪识别模型对中性面孔的系统性“愤怒”过度预测问题(0.194 vs 约 0.05 的西方先验),使 WELD 成为情绪识别公平性审计的有价值数据集。该数据集的复杂系统分析将作为伴随预印本(arXiv:2510.16046)发布。

关键词

引用

@article{arxiv.2510.15221,
  title  = {WELD: The First Naturalistic Long-Period Small-Team Workplace Emotion Dataset for Ubiquitous Affective Computing},
  author = {Xiao Sun},
  journal= {arXiv preprint arXiv:2510.15221},
  year   = {2026}
}

备注

v2: Major revision. 30-month report with full ethics framework, 4-tier access model, variance decomposition, HMM regime discovery, AUC=0.79 vs C-index=0.52 turnover-prediction methodology audit, and Asian-neutral-face FER bias finding. Companion: arXiv:2510.16046. 49 employees, 733,780 records, 17 pages. Submitted to IEEE TAFFC