基于查询条件的测试时间自训练
计算与语言
2026-05-15 v2 人工智能
机器学习
摘要
大语言模型(LLM)通常以固定参数部署,其性能常通过在推理时间分配更多计算量来提升。虽然此类测试时间扩展可能有效,但无法纠正模型的误认,或适应单个查询的特定结构。测试时间优化通过在推理期间启用参数更新来克服此限制,但现有方法要么依赖外部数据,要么优化的是通用自监督目标,这些目标缺乏针对性查询的对齐。本文提出查询条件测试时间自训练(QueST)框架,利用源自输入查询本身的监督信息在推理期间适应模型参数。我们的关键洞察是,输入查询本身编码了足够的潜在信号,用于构建结构相关的问题-解答对。基于此,QueST生成此类查询条件问题-解答对,并用作参数效率微调的监督。适应后的模型用于产生最终答案,实现无需任何外部数据的查询特定适应。我们在七个数学推理基准和GPQA-Diamond科学推理基准上表明,QueST consistently优于强大的测试时间优化基线。这些结果表明,查询条件自训练是大语言模型测试时间适应的有效且实用的范式。代码可在https://chssong.github.io/Query-Conditioned-TTST/获取。
引用
@article{arxiv.2605.13369,
title = {Query-Conditioned Test-Time Self-Training for Large Language Models},
author = {Chaehee Song and Minseok Seo and Yeeun Seong and Doyi Kim and Changick Kim},
journal= {arXiv preprint arXiv:2605.13369},
year = {2026}
}
备注
17 pages, 7 figures