中文

道德一致性管道:用于大型语言模型的连续伦理评估

计算与语言 2025-12-03 v1 人工智能

摘要

大型语言模型(LLM)的快速发展与适应性强度凸显了道德一致性——即在多种情境下维持伦理推理连贯性的能力——的重要性。现有对齐框架(alignment frameworks)这类结构化方法旨在将模型行为与人类伦理与社会规范对齐,常依赖静态数据集和事后评估,难以洞察伦理推理在不同情境或时间尺度上的演变。本研究提出道德一致性管道(Moral Consistency Pipeline, MoCoP),这是一种无数据集、闭环的框架,用于持续评估和解释LLM的道德稳定性。MoCoP融合三层支撑结构:(i)词汇完整性分析;(ii)语义风险估计;(iii)基于推理的判断建模,构成一个自主生成、评估与 refinement 的自持架构,无需外部监督。我们的实证结果表明,MoCoP能够有效捕捉LLM的纵向伦理行为,揭示了伦理维度与有害性维度之间呈强烈负相关(相关系数rET=-0.81,p值<0.001),而与响应延迟几乎无关(相关系数rEL≈0)。这些发现表明,道德连贯性与语言安全倾向于作为模型行为的稳定可解释特征,而非短期波动。进一步地,通过将伦理评估重新框定为动态、模型无关的道德内省形式,MoCoP为可扩展的持续审计提供了可复现基础,推动了自主AI系统中计算道德的研究。

关键词

引用

@article{arxiv.2512.03026,
  title  = {The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models},
  author = {Saeid Jamshidi and Kawser Wazed Nafi and Arghavan Moradi Dakhel and Negar Shahabi and Foutse Khomh},
  journal= {arXiv preprint arXiv:2512.03026},
  year   = {2025}
}