中文

Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

人工智能 2026-05-06 v1 机器学习

摘要

大型语言模型常常在不同情境下显示出异质的道德偏好。我们研究在保持 general competence 的同时,针对 desired ethical framework 实现 inference-time steering。我们提出了 Convergent-Divergent Routing 方法,通过追踪和编辑 transformer 块内伦理框架相关路径首先 convergence 然后 divergence 的最小分支点。对这些 locus 的 non-target 分支进行 Gating 可阻止下游传播,同时保持 upstream 计算完整。我们发现,这一干预 alone 即可增加 targeted ethical-framework reasoning。为实现 fine-grained control,我们将 Common Spatial Patterns 适用于 residual stream,从而为每个分支点层提取一对方向,用于区分 utilitarian 和 deontological 框架。我们 then 引入 Dual Logit Calibration,一种闭式形式、minimum-ℓ₂-范数 update,用于将 residual 置于该二维子空间内,使得 resulting directional projections 与 user-specified preference weights 对齐。实验在真实生活道德困境上表明,我们的方法可靠地实现 preference calibration 并大幅保留 general capabilities, outperforming recent baselines,同时提供可解释机制。

关键词

引用

@article{arxiv.2605.03609,
  title  = {Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models},
  author = {Chenchen Yuan and Zheyu Zhang and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2605.03609},
  year   = {2026}
}