可重复性报告:基于最近邻居的大语言模型测试时训练
计算与语言
2025-11-24 v1
摘要
我们复现了《基于最近邻居的大语言模型测试时训练》(Hardt 和 Sun,2024)的核心论点,该论文提出在推理时通过微调检索到的最近邻居序列来适应语言模型。使用预训练的 RoBERTa 嵌入经 Faiss 索引化后检索每个测试输入的 20 个最近邻居,并对 GPT-2(117M、774M)、GPT-Neo(1.3B)和 R1-Distilled-Qwen2.5-1.5B 进行每组最近邻居一次梯度更新。我们的实验表明,测试时训练显著降低了 The Pile 等不同领域中的困惑度和比特每字节指标,在结构化或专业数据集(如 GitHub 和 EuroParl)上的改进最大。我们进一步验证了,未在 The Pile 上预训练的模型从这种适应中受益更大,这使得较小的模型能够接近较大模型的性能。由于基础设施限制,我们引入一种内存高效的检索实现,仅加载所需的行偏移量,而非整个文件,将每个服务器的内存需求从 128 GB 以上降低到 32 GB。我们还通过评估 R1-Distilled-Qwen2.5-1.5B 扩展了原研究,表明即使针对现代优化推理架构,测试时训练也能consistent地获得提升。总体而言,我们的结果支持了最近邻居测试时训练的鲁棒性和通用性,同时突显了大规模检索增强适应复现的实际考虑。
引用
@article{arxiv.2511.16691,
title = {Reproducibility Report: Test-Time Training on Nearest Neighbors for Large Language Models},
author = {Boyang Zhou and Johan Lindqvist and Lindsey Li},
journal= {arXiv preprint arXiv:2511.16691},
year = {2025}
}