AI 的收敛性伦理?基于多框架方法分析大型语言模型中的道德基础优先级
人工智能
2025-04-29 v1 计算机与社会
摘要
随着大型语言模型(LLM)在结果决策情境中日益部署,系统性评估其伦理推理能力已成为关键 imperative。本文引入了优先级推理与内在道德评估框架(Priorities in Reasoning and Intrinsic Moral Evaluation, PRIME)——一种综合性方法,用于分析跨基础伦理维度的道德优先级,包括后果主义-义务论推理、道德基础理论及 Kohlberg 发展阶段理论。我们通过结合直接提问和响应分析既定道德困境的双协议方法,将该框架应用于六大主流 LLM。我们的分析揭示了显著的收敛模式:所有被评估模型均显示出对关怀/伤害和公平/作弊基础的强烈优先级,而持续低估权威、忠诚和神圣等维度。通过细致考察置信度指标、响应犹豫模式及推理一致性,我们确立当代 LLM(1)作出明确伦理判断,(2)在道德决策中表现出显著的跨模型一致性,(3)通常符合实证确定的人类道德偏好。这项研究贡献了一种可扩展的伦理基准方法,同时凸显当前 AI 伦理推理架构的潜在能力与系统性局限——这些见解对负责任地发展日益重要的 AI 系统具有关键意义。
引用
@article{arxiv.2504.19255,
title = {The Convergent Ethics of AI? Analyzing Moral Foundation Priorities in Large Language Models with a Multi-Framework Approach},
author = {Chad Coleman and W. Russell Neuman and Ali Dasdan and Safinah Ali and Manan Shah},
journal= {arXiv preprint arXiv:2504.19255},
year = {2025}
}
备注
25 pages, 8 figures