迈向Transformer测试时计算的理论理解:基于上下文线性回归的研究
机器学习
2025-08-20 v2 人工智能
摘要
在语言模型推理过程中使用更多的测试时计算,例如生成更多中间思考步骤或采样多个候选答案,已被证明能有效显著提升模型性能。本文通过引入随机性和采样,在弥合实际语言模型推理与理论Transformer分析之间的差距方面迈出了初步一步。我们专注于具有连续/二元系数的上下文线性回归,在此框架下,我们通过噪声注入和二元系数采样来模拟语言模型解码。通过该框架,我们对广泛采用的推理技术进行了详细分析。在实证结果的支持下,我们的理论框架和分析展示了为理解现实世界语言模型的推理行为提供新见解的潜力。
引用
@article{arxiv.2508.07571,
title = {Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression},
author = {Xingwu Chen and Miao Lu and Beining Wu and Difan Zou},
journal= {arXiv preprint arXiv:2508.07571},
year = {2025}
}