中文

面向请求拥有状态的测试时训练的批量服务:RW-TTT

机器学习 2026-05-28 v1

摘要

测试时训练 (TTT) 通过读取和更新请求拥有状态(如快速权重、低秩delta或流式学习器状态)来适应LLM的生成。这会破坏批量LLM服务,而后者假设共享的静态权重:串行执行是正确的但缓慢,而粗暴的批量处理可能会损坏请求状态。我们将此问题表述为读写TTT服务,并提出RW-TTT,通过为每个解码步骤标记其拥有者、版本和READ/WRITE影响,仅对兼容的阶段进行批量处理,并仅将更新提交给拥有者。在一张GPU上运行八个快速权重InPlace-TTT流,RW-TTT实现了274.61的aggregate tok/s,相对于顺序服务快9.31倍,相对于每个流的副本(在相同内存预算下)快3.44倍。它在RULER(长上下文基准)上保留了行为,并通过所有权/版本检查。

关键词

引用

@article{arxiv.2605.28053,
  title  = {RW-TTT: Batched Serving for Request-Owned Test-Time Training State},
  author = {Jian Yang and Zhizhuo Kou and Yao Tian and Hao Zhang and Han Chen and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2605.28053},
  year   = {2026}
}