中文

基于社交媒体网络用户的中文多标签情感计算数据集

计算机视觉与模式识别 2024-11-14 v1 人工智能 计算与语言 计算机与社会

摘要

情绪与人格是理解人类心理状态的核心要素。情绪反映个体主观体验,而人格揭示相对稳定的行为与认知模式。现有情感计算数据集常将情绪与人格特质分别标注,缺乏在单标签与多标签分类下对微情绪和情绪强度的细粒度标注。中文情绪数据集极其稀缺,捕捉中文用户人格特质的数据集更是有限。为填补这些空白,本研究从主流社交媒体平台微博采集数据,从 50,000 余名具有多样 MBTI 人格标签的个体中筛选出 11,338 名有效用户,获取 566,900 条帖子及用户 MBTI 人格标签。采用 EQN 方法,我们构建了一个整合同一用户人格特质与六大情绪及微情绪(均标注强度等级)的中文多标签情感计算数据集。多数 NLP 分类模型上的验证结果显示该数据集具有很强的实用性。该数据集旨在推进机器对复杂人类情绪的识别,并为心理学、教育学、市场营销、金融和政治学研究提供数据支持。

关键词

引用

@article{arxiv.2411.08347,
  title  = {A Chinese Multi-label Affective Computing Dataset Based on Social Media Network Users},
  author = {Jingyi Zhou and Senlin Luo and Haofan Chen},
  journal= {arXiv preprint arXiv:2411.08347},
  year   = {2024}
}