基于凸重构和梯度缓存的 LLM 高效测试时微调
机器学习
2026-05-29 v1
摘要
测试时微调(TTFT)是一种快速发展的范式,通过检索相关序列、更新模型然后评估 prompt 来适应每个 prompt。然而,TTFT 只有在速度快的情况下才实用:选择和微调都在每个 query 上发生,成为直接瓶颈。现有方法在速度和质量之间进行权衡:快速检索往往是冗余的,而更强大的 diversity-aware selection 增加了不可接受的 per-query 成本。我们引入 HullFT,一种几何方法来解决这两个瓶颈。给定 query,HullFT 首先将 query embedding 表示为少量 training sequence 的稀疏凸组合,通过高效的 projection-free Frank-Wolfe 优化。这会产生一个天然相关且多样的 support set。我们 then 将分数凸权转换为 exact integer multiset,用于微调,通过几何 integerization 程序实现。产生的 multiplicities 天然创建重复的示例,我们利用 Gradient Reuse 在重复的微调步骤中对 forward-backward 计算进行摊销。我们的实验表明,HullFT 在当前最先进 TTFT 方法的质量-效率 tradeoff 上取得了改进,实现了更低的 bits-per-byte,同时总运行时间显著降低。
引用
@article{arxiv.2605.30337,
title = {Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching},
author = {Alaa Khamis and Alaa Maalouf},
journal= {arXiv preprint arXiv:2605.30337},
year = {2026}
}