语言模型中的结构化道德推理:基于价值的评估框架
人机交互
2025-06-19 v1
摘要
大型语言模型(LLMs)正在部署于需要道德理解的领域,但其推理往往仍显浅显且与人类推理不一致。不同于人类,其道德推理整合了情境权衡、价值体系和伦理理论,而LLMs常依赖表面模式,导致在道德和伦理复杂情境中出现偏见决策。为弥合这一差距,我们提出一个基于价值的框架,用于评估和提炼LLMs中的结构化道德推理。我们在四个道德数据集上对12个开源模型进行基准测试,采用基于价值体系、伦理理论和认知推理策略的提示词分类。我们的评估由四个问题引导:(1)结构化推理是否改善了LLMs的决策质量?(2)哪些类型的值/伦理框架最有效指导LLMs推理?(3)哪些认知推理策略导致更好的道德表现?(4)小型LLMs通过蒸馏能否获得道德能力?我们发现,采用显式道德结构的提示词始终能提高准确性和连贯性,首次原理推理和施氏体系+关怀伦理框架的提示词取得最强提升。此外,我们的监督式蒸馏方法可在无需额外推理成本的情况下,将道德能力从大型模型转移到小型模型。综合而言,我们的结果为通用且基于价值的模型提供了可扩展的路径。
引用
@article{arxiv.2506.14948,
title = {Structured Moral Reasoning in Language Models: A Value-Grounded Evaluation Framework},
author = {Mohna Chakraborty and Lu Wang and David Jurgens},
journal= {arXiv preprint arXiv:2506.14948},
year = {2025}
}