中文

面向大型语言模型的自适应低秩多头自注意力的动态秩强化学习

机器学习 2026-02-10 v2 计算与语言

摘要

动态秩强化学习(DR-RL)近似依赖于静态秩假设,限制了其在不同语言情境下的灵活性。我们的方法根据实时序列动态、层级特异性以及硬件约束动态调节秩。核心创新是一个深度强化学习智能体,将秩选择问题形式化为顺序策略优化问题,严格平衡注意力保真度与计算延迟。为确保推理期间的稳定性,我们推导并运用在线矩阵扰动界限,使能够在不昂贵完整分解的情况下进行增量秩更新。此外,轻量级基于 Transformer 的策略网络和批量奇异值分解(SVD)操作确保了在现代体系结构上的可扩展部署。广泛的实验表明,DR-RL 在序列长度大于 4096 的长序列情景中将浮点运算量(FLOPs)降低超过 40%,同时保持下游准确率在统计上等同于全秩注意力。除了标准语言建模基准测试外,我们在 GLUE 基准测试上验证了 DR-RL 的实际应用性。具体而言,我们的方法在 SST-2 情感分析任务上实现 92.78% 的准确率,匹配全秩基线的性能,并显著优于如 Performer 和 Nystr"omformer 等静态低秩方法。

关键词

引用

@article{arxiv.2512.15973,
  title  = {Dynamic Rank Reinforcement Learning for Adaptive Low-Rank Multi-Head Self Attention in Large Language Models},
  author = {Caner Erden},
  journal= {arXiv preprint arXiv:2512.15973},
  year   = {2026}
}