信念动力学揭示内在学习与激活引导的双重本质
组合数学
2025-11-04 v1
摘要
大型语言模型(LLMs)可以通过提示(内在学习)和内部激活(激活引导)在推理时进行控制。虽然已提出不同的解释框架来说明这些方法,但它们的共同目标是控制模型行为,于是引出了一个问题:这些看似迥异的方法是否可被视为更广泛框架的具体实例?为此,我们从贝叶斯视角开发了一个统一且可预测的LLM控制框架。具体而言,我们认为基于情境的干预和基于激活的干预通过改变模型对潜在概念的信念来影响其行为:引导通过改变概念先验实现,而内在学习导致证据的累积。这导致一个高度可预测的贝叶斯模型,能够在灵感来自许多shot内在学习领域的一组领域中,对基于情境和基于激活的干预作出预测。该模型帮助我们解释先前的经验现象——例如随着内在学习证据的积累呈现出S形学习曲线——同时预测了新的现象——例如两种干预在对数信念空间中的可加性,这导致离散的相位,如轻微改变干预控制即可诱发剧烈的行为变化。总体而言,本工作提供了统一的解释框架,说明提示驱动和激活驱动的LLM行为控制,以及实证预测这些干预效果的方法。
引用
@article{arxiv.2511.00616,
title = {Bipartite holes, degree sums and Hamilton cycles},
author = {Mark Ellingham and Yixuan Huang and Bing Wei},
journal= {arXiv preprint arXiv:2511.00616},
year = {2025}
}