语言模型在预训练期间如何出现可控性
机器学习
2025-08-05 v1 人工智能
摘要
语言模型可以通过修改其内部表示来控制诸如情感、风格或真实性等概念的生成。然而,有效干预的条件尚不清晰,往往是通过启发式方法和试错进行验证。为填补这一空白,我们展示了干预效能(即通过对隐藏状态进行线性变换来调整输出的能力)在训练中期阶段便会显现。此外,even closely related concepts(例如愤怒和悲伤)也 exhibit 在训练不同阶段显示可控性。为了更好地解释训练期间可控性的动态,我们将现有的干预技术适应为统一框架,称为“干预探测器”(ID),旨在通过隐藏状态和表示分析揭示线性可控性在训练过程中是如何演化的。ID 揭示了概念在隐藏空间中逐渐变得更加线性可分,这与线性可控性的显现密切相关。我们进一步引入了 ID 基于的指标,如热图、熵趋势和余弦相似度,以帮助解释训练期间线性可控性的演化。此外,我们在不同模型家族中应用 ID 以确保我们在可控性动态方面的发现具有普遍性。
引用
@article{arxiv.2508.01892,
title = {How Does Controllability Emerge In Language Models During Pretraining?},
author = {Jianshu She and Xinyue Li and Eric Xing and Zhengzhong Liu and Qirong Ho},
journal= {arXiv preprint arXiv:2508.01892},
year = {2025}
}