中文

UIO-LLMs:面向长上下文大语言模型的无偏增量优化

计算与语言 2025-09-15 v3

摘要

由于有限的上下文窗口大小,管理长文本对大语言模型(LLMs)来说具有挑战性。本研究引入了UIO-LLMs,一种用于长上下文设置下记忆增强型Transformer的无偏增量优化方法。我们首先将该过程概念化为一个简化的编码器-解码器框架,其中权重共享的编码器和解码器分别将上下文片段封装到记忆中,并利用这些记忆来预测后续片段的输出。随后,通过将我们的记忆增强型Transformer视为全连接循环神经网络(RNN),我们使用截断反向传播通过时间(TBPTT)算法来优化训练过程,该算法包含了创新的增量优化技术。这些技术不仅降低了时间复杂度,还通过无偏优化过程解决了梯度计算中的偏差问题。UIO-LLMs成功处理了长上下文,例如将Llama2-7b-chat的上下文窗口从4K扩展到100K个token,仅增加了2%的额外参数,同时推理成本随上下文长度增加几乎保持线性。

关键词

引用

@article{arxiv.2406.18173,
  title  = {UIO-LLMs: Unbiased Incremental Optimization for Long-Context LLMs},
  author = {Wenhao Li and Mingbao Lin and Yunshan Zhong and Shuicheng Yan and Rongrong Ji},
  journal= {arXiv preprint arXiv:2406.18173},
  year   = {2025}
}

备注

This article was not accepted, and its quality is not very good. Therefore, we have decided to withdraw the submission and will not resubmit it elsewhere