后训练如何重塑大语言模型:关于知识、真实性、拒绝与置信度的机制性视角
计算与语言
2025-11-11 v3 人工智能
机器学习
摘要
后训练对于大语言模型 (LLM) 的成功至关重要,将预训练的基础模型转化为更有用且更具对齐性的后训练模型。尽管已有大量研究探讨了后训练算法并通过模型输出对后训练模型进行评估,但有关后训练如何在内部重塑 LLM 的研究仍属空白。本文从四个视角对比研究基础模型和后训练模型的机制性差异,以更好理解后训练的影响。我们的发现表明:(1) 后训练不会改变事实知识的存储位置,而是对基础模型的知识表示进行适应性调整并发展出新的知识表示;(2) 真实性和拒绝都可以在隐藏表示空间中由向量表示。真实性方向在基础模型和后训练模型之间高度相似,并且可以有效用于干预;(3) 拒绝方向在基础模型和后训练模型之间存在差异,表现出有限的前向可迁移性;(4) 基础模型和后训练模型之间的置信度差异不能归因于熵神经元。我们的研究为理解后训练期间保留和改变的基本机制提供了见解,促进下游任务如模型操控,并可能为可解释性和 LLM 后训练的未来研究带来益处。我们的代码已公开于 https://github.com/HZD01/post-training-mechanistic-analysis。
引用
@article{arxiv.2504.02904,
title = {How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence},
author = {Hongzhe Du and Weikai Li and Min Cai and Karim Saraipour and Zimin Zhang and Himabindu Lakkaraju and Yizhou Sun and Shichang Zhang},
journal= {arXiv preprint arXiv:2504.02904},
year = {2025}
}
备注
COLM 2025