预测性伦理建模中的一些问题:一份带注释的“道德故事”对比集
人工智能
2024-07-09 v1 计算与语言
摘要
像 Delphi 这样的模型已经能够以惊人的准确率将伦理困境标记为道德或不道德。本文通过识别将道德困境转化为基于文本的输入时的问题,挑战了准确性作为伦理建模整体指标的有效性。我们通过对比集展示了这些问题,这些对比集显著降低了在数据集 Moral Stories 上训练的分类器的性能。最终,我们获得了具体估计,即特定形式的数据误表示对分类器准确性的损害程度。具体而言,对情境描述性内容的标签更改调整(小至 3-5 个词)可以将分类器准确性降低至低至 51%,几乎是初始准确性 99.8% 的一半。将情境与误导性的社会规范关联起来,将准确性降低至 98.8%,而添加文本偏差(即暗示某个情境已经符合某个特定标签)将准确性降低至 77%。这些结果表明,不仅许多伦理模型已经严重过拟合,而且需要采取若干预防措施来确保输入准确捕捉道德困境。本文建议重新审视社会规范的结构,训练模型通过可废止推理来询问上下文,并过滤输入中的文本偏差。这样做不仅为我们提供了数据误表示对伦理准确性平均成本的首个具体估计,而且为研究人员提供了在研究中考虑这些估计的实用技巧。
引用
@article{arxiv.2407.05244,
title = {Some Issues in Predictive Ethics Modeling: An Annotated Contrast Set of "Moral Stories"},
author = {Ben Fitzgerald},
journal= {arXiv preprint arXiv:2407.05244},
year = {2024}
}
备注
This project was a runner-up to the Novel Research prize for the BlueDot Impact course AI Safety Fundamentals. View my contrast set as JSONL, the UI used to generate it, and Emelin et. al."s initial paper and code at https://github.com/bfitzgerald3132/MoralStoriesContrastSet