中文

直截了当的路径:大语言模型是否拥有内在道德路径?

计算与语言 2026-01-16 v1

摘要

提升大型语言模型(LLM)的道德对齐是AI安全中的关键挑战。当前对齐技术常以表面式警戒手段为主,未触及LLM内在的道德表征。本文借助道德基础理论(MFT),构建LLM细粒度道德景观的映射与操控机制。通过跨语言线性探测,我们验证了中间层道德表征的共享性,并发现英语与中文之间存在共享但差异化的道德子空间。基于此,我们提取可操控的道德向量,成功证明其在内在层面和行为层面的有效性。凭借道德的高普适性,我们提出自适应道德融合(AMF)——一种动态推理时干预方法,融合探测检测与向量注入,针对性解决安全性与有用性之间的权衡。实证结果表明,我们的方法作为一种针对性的内在防御,能有效降低对善意查询的错误拒绝率,同时显著降低基线方法的越狱成功率。

关键词

引用

@article{arxiv.2601.10307,
  title  = {The Straight and Narrow: Do LLMs Possess an Internal Moral Path?},
  author = {Luoming Hu and Jingjie Zeng and Liang Yang and Hongfei Lin},
  journal= {arXiv preprint arXiv:2601.10307},
  year   = {2026}
}