中文

基于多Shot 提示的测试时适应:优势、局限与陷阱

机器学习 2026-03-18 v3 计算与语言

摘要

测试时适应允许大语言模型(LLMs)在推理过程中无需更新模型参数即可修改其行为。常见方法是多Shot 提示,即注入大量基于情境学习(ICL)的示例作为输入空间的测试时更新。尽管随着示例数量增加可以提升性能,但这种更新机制的可靠性与局限性仍不为人所了解,尤其是针对开源模型。我们对多Shot 提示在不同任务与模型架构上的表现进行了实证研究,分析了性能随更新幅度、示例排序方式及选择策略的变化规律。我们进一步研究了动态 ICL 与强化 ICL 作为替代性测试时更新策略,这些策略控制所注入信息的选择方式及其对模型行为的约束。我们发现,多Shot 提示对结构化任务有效,因示例提供的高信息增益,但对选择策略高度敏感,且在开放式生成任务中往往显示有限的收益。总体而言,我们刻画了基于提示的测试时适应的实践局限,并阐明了何时应 beneficial 何时会 harmful 于输入空间更新。

关键词

引用

@article{arxiv.2603.05829,
  title  = {Test-Time Adaptation via Many-Shot Prompting: Benefits, Limits, and Pitfalls},
  author = {Shubhangi Upasani and Chen Wu and Jay Rainton and Bo Li and Urmish Thakker and Changran Hu and Qizheng Zhang},
  journal= {arXiv preprint arXiv:2603.05829},
  year   = {2026}
}