何时思考:基于测试时训练的自适应计算分配用于代码生成
机器学习
2026-01-06 v1 计算与语言
摘要
大型语言模型对所有输入应用统一计算,无论其难度。我们提出 PonderTTT 门控策略,利用 TTT 层的自监督重构损失有选择性地触发测试时训练 (TTT) 更新。该门控决策本身无需训练——不需学习分类器或辅助网络,仅需一个标量阈值初始在无标签数据上校准,并通过指数移动平均 (EMA) 持续调整以维持目标更新率。我们的实验使用 GPT-2 模型(124M 至 1.5B 参数)在代码语言建模(The Stack v2,教师强制困惑度)上表明,该信号兼容推理,不需要 ground-truth 标签。我们的重构门控在 82-89% 的 Oracle Recovery 率下表现出色,完全无训练地显著优于随机跳过基线(在 OOD 语言上损失降低最高可达 16%)。
引用
@article{arxiv.2601.00894,
title = {When to Ponder: Adaptive Compute Allocation for Code Generation via Test-Time Training},
author = {Gihyeon Sim},
journal= {arXiv preprint arXiv:2601.00894},
year = {2026}
}
备注
14 pages, 1 figure, 14 tables, code available at https://github.com/deveworld/ponderTTT