道德基础 Reddit 语料库
计算与语言
2026-03-19 v4 计算机与社会
机器学习
摘要
道德框架与情感会影响多种线上与线下行为,包括捐赠、环保行动、政治参与和抗议。自然语言处理(NLP)中的各种计算方法已被用于从文本数据中检测道德情感,但在此类主观任务中取得强劲性能需要大规模人工标注数据集。先前标注了道德情感的语料库已被证明具有价值,并在 NLP 内部及整个社会科学中产生了新的见解,但仅限于 Twitter。为促进增进我们对道德修辞作用的理解,我们提出道德基础 Reddit 语料库,这是一个由从 12 个不同子版块精心收集的 16,123 条英文 Reddit 评论组成的集合,由至少三名受过训练的标注者基于更新的道德基础理论(MFT)框架对 8 类道德情感(即关怀、比例性、平等、纯洁、权威、忠诚、薄道德、内隐/外显道德)进行人工标注。我们使用大语言模型(Llama3-8B、Ministral-8B)在零样本、少样本和 PEFT(参数高效微调)设置下评估基线,将其性能与 BERT(来自 Transformer 的双向编码器表示)等微调的仅编码器模型进行比较。结果表明,在此主观任务上 LLM 仍落后于微调的编码器,凸显了用于 AI 对齐评估的人工标注道德语料库的持续需求。
引用
@article{arxiv.2208.05545,
title = {The Moral Foundations Reddit Corpus},
author = {Jackson Trager and Alireza S. Ziabari and Elnaz Rahmati and Aida Mostafazadeh Davani and Preni Golazizian and Farzan Karimi-Malekabadi and Ali Omrani and Zhihe Li and Brendan Kennedy and Georgios Chochlakis and Nils Karl Reimer and Melissa Reyes and Kelsey Cheng and Mellow Wei and Christina Merrifield and Arta Khosravi and Evans Alvarez and Morteza Dehghani},
journal= {arXiv preprint arXiv:2208.05545},
year = {2026}
}