中文

ARACH:通过全局注意力重新分配提升LLM的无训练推理插件

计算与语言 2026-03-13 v1 人工智能

摘要

大型语言模型(LLM)取得了显著的性能,但进一步提升往往需要高昂的训练成本。这促使日益增长的兴趣转向后训练技术——尤其是无训练方法,在推理时改进模型而无需更新权重。大多数无训练方法将模型视为黑盒,通过输入/输出级别的干预(如提示设计、通过重复抽样、重排序/验证或搜索实现测试时扩展)来提高输出。在此基础上,他们很少提供一种即插即用的机制来干预模型的内部计算。我们提出ARACH(注意力通过自适应上下文中心重新分配),一种无训练的推理时插件,通过自适应上下文中心聚合上下文并重新分配注意力来增强LLM。在多个语言建模任务上的大量实验表明,ARACH以有限的推理开销和无参数更新方式实现了一致的改进。注意力分析进一步表明,ARACH减轻了注意力sink现象。这些结果表明,工程化模型的内部计算提供了一种不同于基于提示的测试时方法和训练基础的后训练方法的全新推理时策略。

关键词

引用

@article{arxiv.2603.11067,
  title  = {Summarize Before You Speak with ARACH: A Training-Free Inference-Time Plug-In for Enhancing LLMs via Global Attention Reallocation},
  author = {Jingtao Wang and Yucong Wang and Jun Ding and Rui Cai and Xun Wang},
  journal= {arXiv preprint arXiv:2603.11067},
  year   = {2026}
}