中文

分析六大大型语言模型的伦理逻辑

人工智能 2025-01-16 v1 计算机与社会

摘要

本研究检阅了六大主流生成式大型语言模型:OpenAI GPT-4o、Meta LLaMA 3.1、Perplexity、Anthropic Claude 3.5 Sonnet、Google Gemini 以及 Mistral 7B。研究探讨了这些模型如何阐述和应用伦理逻辑,尤其是在回应道德困境问题时,如《车轮问题》(Trolley Problem)和《海因茨困境》(Heinz Dilemma)。不同于传统的对齐研究,本研究采用解释性-透明度框架,要求模型解释其伦理推理过程。该方法通过三种既定的伦理类型学进行分析:后果主义-义务论分析、道德基础理论(Moral Foundations Theory)以及科尔伯格道德发展模型(Kohlberg Stages of Moral Development Model)。研究发现,大型语言模型呈现出高度一致的伦理逻辑,特征为理性主义、后果主义倾向,决策常常优先考虑最小化伤害和公平。尽管预训练和模型架构相似,由于微调和后训练过程的差异,各模型在伦理推理上仍存在细微且显著的差异。这些模型始终表现出严谨、谨慎和自我意识,呈现出类似道德哲学博士后水平的伦理推理。在惊人的一致性下,这些系统都描述其伦理推理比典型人类道德逻辑更为复杂。

关键词

引用

@article{arxiv.2501.08951,
  title  = {Analyzing the Ethical Logic of Six Large Language Models},
  author = {W. Russell Neuman and Chad Coleman and Manan Shah},
  journal= {arXiv preprint arXiv:2501.08951},
  year   = {2025}
}