中文

通过早期退出控制语言模型受损上下文的风险

人工智能 2026-05-29 v3 机器学习

摘要

大型语言模型(LLM)可能受到有害或无关上下文的影响,这会显著损害下游任务的性能。这激励包含内置机制以防止此类“垃圾进,垃圾出”情形的原则性设计。我们提出了一种新方法,以限制有害上下文对模型性能的降低程度。首先,我们定义基准“安全”行为——即在无上下文情况下模型的性能(零样本)。接着,我们应用分布式无风险控制(DFRC)来控制用户提供的上下文将性能衰减至安全零样本基准的程度。我们通过动态早期退出预测实现这一点,忽略注意力最高地关注不安全输入的后续注意力头。最后,我们提出了 DFRC 的修改方案,使其能够控制有害输入的风险,同时利用有益输入的性能和效率收益。我们在覆盖面广泛的9个任务上 presenting both theoretical and empirical results,包括 in-context learning 和开放式问答,表明该方法能够有效控制有害上下文的风险,同时在有益上下文上实现显著的计算效率提升。

关键词

引用

@article{arxiv.2510.02480,
  title  = {Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting},
  author = {Andrea Wynn and Metod Jazbec and Charith Peris and Rinat Khaziev and Anqi Liu and Daniel Khashabi and Eric Nalisnick},
  journal= {arXiv preprint arXiv:2510.02480},
  year   = {2026}
}

备注

Accepted to ICML 2026