中文

道德基础微博语料库

计算与语言 2024-11-15 v1 机器学习

摘要

自然语言中表达的道德情感显著影响线上和线下环境,塑造行为风格和交互模式,包括社交媒体自我呈现、网络霸凌、遵守社会规范和道德决策。为了在自然语言处理文本中有效衡量道德情感,利用大型标注数据集以提供细致理解以进行准确分析和模型训练至关重要。然而,现有语料库虽然有价值,但往往面临语言局限性。为了填补中文领域的这一空白,我们引入了道德基础微博语料库。该语料库包含微博上 25,671 条中文评论,涵盖六个不同主题领域。每条评论由至少三名系统训练的标注员根据基于道德扎根理论的十个道德类别进行人工标注。为了评估标注员可靠性,我们给出了 Kappa 检验结果,这是衡量一致性的金标准。此外,我们应用多个最新大语言模型来补充人工标注,开展分析实验比较其性能,并报告道德情感分类的基线结果。

关键词

引用

@article{arxiv.2411.09612,
  title  = {The Moral Foundations Weibo Corpus},
  author = {Renjie Cao and Miaoyan Hu and Jiahan Wei and Baha Ihnaini},
  journal= {arXiv preprint arXiv:2411.09612},
  year   = {2024}
}