ROSA-Tuning:通过后缀匹配增强长上下文建模
计算与语言
2026-02-05 v2
摘要
长上下文能力和计算效率是当今大型语言模型面临的核心挑战。现有高效注意力方法降低了计算复杂度,但通常 suffer from 模型状态覆盖范围有限。本文提出了 ROSA-Tuning,一种用于增强预训练模型长上下文建模能力的检索与召回机制。除标准注意力机制外,ROSA-Tuning 并行利用基于 CPU 的 ROSA(RWKV 在线后缀自动机)检索模块,高效定位与当前查询相关的长上下文中的历史位置,并以可训练方式注入检索信息;随后可通过受限范围的注意力进行加权融合。为实现端到端训练,我们采用二进制离散化策略和反事实梯度算法,并通过异步 CPU-GPU 流水线进一步优化整体执行效率。在 Qwen3-Base-1.7B 上的系统评估表明,ROSA-Tuning 在长Bench等基准测试上显著恢复了窗口注意力模型的长上下文建模能力,性能接近甚至在某些情况下匹配全局注意力,同时保持与窗口注意力方法几乎可比的计算效率和 GPU 内存占用,为高效长上下文处理提供了新的技术路径。示例代码可在 https://github.com/zyaaa-ux/ROSA-Tuning 查看。
引用
@article{arxiv.2602.02499,
title = {ROSA-Tuning: Enhancing Long-Context Modeling via Suffix Matching},
author = {Yunao Zheng and Xiaojie Wang and Lei Ren and Wei Chen},
journal= {arXiv preprint arXiv:2602.02499},
year = {2026}
}