通过伦理推理实现大型语言模型的多样化人类价值对齐
人工智能
2025-11-04 v1 计算与语言
摘要
确保大型语言模型(LLM)在不同地区和文化中与多样化且不断演变的人类价值观实现对齐,是人工智能伦理学中的一个关键挑战。当前的对齐方法往往产生表面化的顺从,而非真正的伦理理解,无法解决人类价值观的复杂且具有情境依赖性。本文提出了一种新颖的伦理推理范式,灵感来自已建立的伦理决策模型,旨在通过 deliberative 伦理推理来增强多样化人类价值对齐。我们的框架包括结构化的五个步骤:情境性事实收集、分层社会规范识别、方案生成、多视角伦理影响分析以及反思。这一理论驱动的方法指导LLM通过可解释的推理过程,增强其理解地区特定性并执行细致的伦理分析,这可以采用提示工程或监督微调方法实现。我们在专为区域价值对齐设计的SafeWorld基准测试上进行评估。实验结果表明,我们的框架显著优于基线方法,提高了LLM对多样化人类价值的对齐程度,使其能够更准确地识别社会规范并进行更符合文化的推理。我们的工作为通过跨学科研究,为开发更有效地与全球社会多层次价值观相匹配的LLM提供了具体路径。
引用
@article{arxiv.2511.00379,
title = {Diverse Human Value Alignment for Large Language Models via Ethical Reasoning},
author = {Jiahao Wang and Songkai Xue and Jinghui Li and Xiaozhen Wang},
journal= {arXiv preprint arXiv:2511.00379},
year = {2025}
}
备注
Accepted by AIES 2025, camera-ready version