In-Context奥卡姆的瑞:Transformer如何在现场偏好更简单的假设
机器学习
2025-06-25 v1 人工智能
计算与语言
机器学习
摘要
In-context学习(ICL)使transformer能够通过上下文示例而无需参数更新地适应新任务。虽然现有研究通常在固定复杂度环境中研究ICL,但实际语言模型遇到的任务跨越多样复杂度水平。本文探讨transformer如何导航层次化任务结构,其中更高复杂度类别可以完美表示由更简单类别生成的任何模式。我们设计基于马尔可夫链和线性回归的受控测试环境,揭示transformer不仅识别每个任务的适当复杂度水平,还能准确推断相应参数——即使上下文示例与多个复杂度假设兼容。值得注意的是,当面对由更简单过程生成的数据时,transformer始终偏好最不复杂的充分解释。我们通过贝叶斯框架理论解释了这种行为,表明transformer有效实现了通过在模型拟合与复杂度惩罚之间权衡来实现的In-Context贝叶斯奥卡姆的瑞。我们进一步对模型规模、训练混合分布、推理上下文长度和体系结构的作用进行了消融实验。最后,我们在GPT-4模型上以布尔函数任务为案例研究验证了这种奥卡姆的瑞式归纳偏差,表明它可能是训练于多样任务分布的transformer的固有特性。
关键词
引用
@article{arxiv.2506.19351,
title = {In-Context Occam's Razor: How Transformers Prefer Simpler Hypotheses on the Fly},
author = {Puneesh Deora and Bhavya Vasudeva and Tina Behnia and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2506.19351},
year = {2025}
}
备注
28 pages, 19 figures