构建道德决策的可解释模型
人工智能
2026-02-05 v2 计算机与社会
机器学习
摘要
我们构建了一个自定义变换模型,以研究神经网络如何在坡车式困境中做出道德决策。该模型使用编码化的结构化情景嵌入,这些嵌入编码了受影响者、人数以及他们所属的结果。我们的 2 层架构在 Moral Machine 数据上实现了 77% 的准确率,同时足够小,以便进行详细分析。我们使用不同的可解释性技术来揭示道德推理如何在网络中分布,并演示了偏见如何局部化到网络中的不同计算阶段等其他发现。
引用
@article{arxiv.2602.03351,
title = {Building Interpretable Models for Moral Decision-Making},
author = {Mayank Goel and Aritra Das and Paras Chopra},
journal= {arXiv preprint arXiv:2602.03351},
year = {2026}
}
备注
8 pages, 4 figures, accepted to AAAI'26 Machine Ethics Workshop