中文

关于悖论性道德自我纠正的论述 heuristics

计算与语言 2025-11-04 v2

摘要

道德自我纠正已成为一种引导大型语言模型(LLM)输出符合人类道德价值观的有前景的方法。然而,道德自我纠正技术面临两个主要悖论。首先,尽管存在实证和理论证据表明自我纠正有效,但这种 LLM 能力仅在表层水平运行。其次,尽管 LLM 具备自诊断其输出道德不一致的能力,但在自我纠正过程中,却难以识别这种道德不一致的根源。为更好地理解和解决这些悖论,我们分析了旨在增强道德自我纠正的微调语料库中的话语结构,发现了有效构造背后的 heuristic 机制。我们展示,道德自我纠正依赖反映 heuristic 捷径的话语构造,而这些 heuristic 捷径在自我纠正过程中存在,导致试图同时增强自我纠正和自我诊断能力时出现不一致。基于我们的发现,我们提出了一种解决方案,通过利用精选数据集的 heuristic 机制来提高道德自我纠正。我们还指出了这一能力的泛化挑战,特别是关于从情境上下文中学习和模型规模的问题。

关键词

引用

@article{arxiv.2507.00985,
  title  = {Discourse Heuristics For Paradoxically Moral Self-Correction},
  author = {Guangliang Liu and Zimo Qi and Xitong Zhang and Kristen Marie Johnson},
  journal= {arXiv preprint arXiv:2507.00985},
  year   = {2025}
}