中文

基于惊讶感的残差测试时训练

机器学习 2026-03-10 v1 人工智能 计算与语言

摘要

测试时训练(TTT)语言模型通过用自监督学习期间更新的隐藏状态“快速权重”W_fast取代标准的精确注意KV缓存,实现了理论上无限的上下文窗口且具有O(1)的内存占用。然而,纯粹的TTT架构在精确记忆任务(例如 Needle-in-a-Haystack)上会出现灾难性失败。由于快速权重会积极地将上下文压缩进入信息瓶颈,高度惊讶或独特的标记会被后续标记梯度更新迅速覆盖和遗忘。我们引入SR-TTT(Surprisal-Aware Residual Test-Time Training,即基于惊讶感的残差测试时训练),通过增强TTT主干架构的损失门控稀疏记忆机制来解决此记忆失败。通过动态将仅不可压缩、高度惊讶的标记路由到传统的精确注意 Residual Cache,SR-TTT在低熵背景上下文上保持O(1)的内存占用,同时仅对关键needle使用精确注意。我们的完整实现、训练脚本和预训练权重已开源可用:https://github.com/swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training。

关键词

引用

@article{arxiv.2603.06642,
  title  = {SR-TTT: Surprisal-Aware Residual Test-Time Training},
  author = {Swamynathan V P},
  journal= {arXiv preprint arXiv:2603.06642},
  year   = {2026}
}

备注

7 pages, 5 figures