XL3M:基于分段推理的无训练大语言模型长度扩展框架
计算与语言
2024-05-29 v1 人工智能
摘要
长度泛化失败问题,即大语言模型(LLM)未能泛化到超过其最大训练长度的文本,严重限制了LLM在面向流式长输入场景中的应用。为解决此问题,现有方法要么需要高额成本,要么会引入精度损失。本文我们经验性地发现,LLM预测准确率与其确定性高度相关。基于此,我们提出一种高效无训练框架,称为XL3M(意为extra-long large language model),使训练于短序列的LLM能够在无需进一步训练或微调的情况下推理极长序列。在XL3M框架下,输入上下文首先被分解为多个短子上下文,其中每个子上下文包含一个独立的子段和来自原上下文末尾几个token的公共“问题”。然后,XL3M提供一种衡量每个子段与“问题”相关性的方法,并通过按时间顺序拼接所有相关子段来构建简洁的关键上下文。关键上下文随后用于替代原有上下文完成推理任务。全面基准测试评估表明,XL3M的优越性得到了充分验证。使用我们的框架,一个Llama2-7B模型即可在8张华为Ascend 910B NPU卡(每卡64GB内存)上推理长度为2000万(20M)的超长序列。
引用
@article{arxiv.2405.17755,
title = {XL3M: A Training-free Framework for LLM Length Extension Based on Segment-wise Inference},
author = {Shengnan Wang and Youhui Bai and Lin Zhang and Pingyi Zhou and Shixiong Zhao and Gong Zhang and Sen Wang and Renhai Chen and Hua Xu and Hongwei Sun},
journal= {arXiv preprint arXiv:2405.17755},
year = {2024}
}
备注
11 pages, 5 figures