中文

大型语言模型的训练-free 测试时对比学习

计算与语言 2026-04-16 v1 人工智能

摘要

大型语言模型(LLM)表现出强大的推理能力,但在分布迁移下性能常下降。现有测试时适应(TTA)方法依赖基于梯度的更新,需获取白盒访问并产生显著开销,而训练-free 方案要么是静态的,要么依赖外部指导。在本文中,我们提出了训练-free 测试时对比学习 TF-TTCL,一个训练-free 适应框架,使冻结的 LLM 能通过从自身推理经验中蒸馏监督信息来实现在线改进。具体而言,TF-TTCL 通过三个核心模块实现动态的“探索-反思-引导”循环:1) 语义查询增强首先通过多智能体角色扮演来多样化问题视角,生成不同的推理轨迹;2) 对比经验蒸馏 then 捕捉优势轨迹与劣势轨迹之间的语义差距,将其蒸馏为显式文本规则;3) 上下文规则检索最后在推理期间激活这些存储的规则,以动态引导冻结的 LLM 走向稳健的推理模式,同时避免已观察到的错误。大量实验在封闭式推理任务和开放式评估任务上表明,TF-TTCL 在线评估下 consistently 优于强大的零-shot 基线和代表性 TTA 方法。代码已公开 https://github.com/KevinSCUTer/TF-TTCL。

关键词

引用

@article{arxiv.2604.13552,
  title  = {Training-Free Test-Time Contrastive Learning for Large Language Models},
  author = {Kaiwen Zheng and Kai Zhou and Jinwu Hu and Te Gu and Mingkai Peng and Fei Liu},
  journal= {arXiv preprint arXiv:2604.13552},
  year   = {2026}
}

备注

Accepted by Findings ACL 2026