中文

构建道德决策的可解释模型

人工智能 2026-02-05 v2 计算机与社会 机器学习

摘要

我们构建了一个自定义变换模型,以研究神经网络如何在坡车式困境中做出道德决策。该模型使用编码化的结构化情景嵌入,这些嵌入编码了受影响者、人数以及他们所属的结果。我们的 2 层架构在 Moral Machine 数据上实现了 77% 的准确率,同时足够小,以便进行详细分析。我们使用不同的可解释性技术来揭示道德推理如何在网络中分布,并演示了偏见如何局部化到网络中的不同计算阶段等其他发现。

关键词

引用

@article{arxiv.2602.03351,
  title  = {Building Interpretable Models for Moral Decision-Making},
  author = {Mayank Goel and Aritra Das and Paras Chopra},
  journal= {arXiv preprint arXiv:2602.03351},
  year   = {2026}
}

备注

8 pages, 4 figures, accepted to AAAI'26 Machine Ethics Workshop