中文

更小的大语言模型也能进行道德自我修正

计算与语言 2025-03-04 v2

摘要

自我修正是大语言模型(LLM)最令人瞩目的新兴能力之一,使 LLM 能够根据描述输出问题的自然语言反馈自行修改不适当的输出。道德自我修正是一种事后修正不道德生成的方法,无需梯度更新,因此既计算轻量又能保留语言建模能力。之前的工作已表明 LLM 可以自我去偏,并且据报道参数少于 22B 的小模型不具备道德自我修正能力。然而,尚无直接证据解释为何此类较小模型在道德自我修正方面表现不佳,尽管先前研究假设大模型更擅长遵循指令和理解抽象社会规范。在本文中,我们通过细致的提示,在社会刻板印象的背景下实证验证了这一假设。我们的实验结果表明:(i) 令人惊讶的是,经过适当安全对齐微调的 3.8B LLM 可以取得非常好的道德自我修正性能,凸显了安全对齐的显著影响;(ii) 小型 LLM 确实比大规模模型在理解社会规范和通过思维链进行自我解释方面更弱,但所有规模的 LLM 在收到不道德指令时都表现出糟糕的自我修正性能。

关键词

引用

@article{arxiv.2410.23496,
  title  = {Smaller Large Language Models Can Do Moral Self-Correction},
  author = {Guangliang Liu and Zhiyu Xue and Xitong Zhang and Rongrong Wang and Kristen Marie Johnson},
  journal= {arXiv preprint arXiv:2410.23496},
  year   = {2025}
}