大语言模型是否是复杂伦理困境的分析者?
计算与语言
2025-05-14 v1 人工智能
摘要
关于大型语言模型(LLM)是否能够模拟人类的伦理推理并作为人类判断的可信代理这一问题,仍是开放状态。为此,我们引入了一个由196个真实世界伦理困境及专家意见组成的基准数据集,每个问题均被细分为五个结构化组成部分:引入、关键因素、历史理论视角、解决策略和关键要点。我们还收集了非专家的人类响应数据用于比较,仅限于关键因素部分due to其简洁性。我们评估了多款前沿大语言模型(GPT-4o-mini、Claude-3.5-Sonnet、Deepseek-V3、Gemini-1.5-Flash),采用基于BLEU、达摩尔-莱文希坦距离、TF-IDF余弦相似度和通用句子编码相似度的复合指标框架。通过反向排序对齐和成对层次分析法(AHP)计算指标权重,实现对模型输出与专家响应的细粒度比较。我们的结果表明,大语言模型在词汇和结构对齐方面总体优于非专家人类,其中GPT-4o-mini在所有部分表现最为一致。然而,所有模型在历史 grounding 和提出细致解决策略方面都存在挑战,这需要情境抽象能力。人类响应虽然结构性较弱,但偶尔能够实现相当的语义相似度,表明其具有直观的道德推理能力。这些发现凸显了大语言模型在伦理决策方面的优势与当前局限性。
引用
@article{arxiv.2505.08106,
title = {Are LLMs complicated ethical dilemma analyzers?},
author = {Jiashen and Du and Jesse Yao and Allen Liu and Zhekai Zhang},
journal= {arXiv preprint arXiv:2505.08106},
year = {2025}
}
备注
CS194-280 Advanced LLM Agents project. Project page: https://github.com/ALT-JS/ethicaLLM