LIFT:通过长输入微调提升大语言模型长程文本理解的新型框架
计算与语言
2026-04-14 v5
摘要
长程文本理解是大语言模型面临的挑战,因其受限的上下文窗口。本文引入 Long Input Fine-Tuning (LIFT),一种用于长程文本建模的新型框架,可通过动态适应给定长输入来提升任意短程大语言模型的长程文本性能。重要的是,LIFT 并非通过不断扩大上下文窗口大小来容纳日益更长的输入,而是将长输入存储并吸收至模型参数中。通过对长输入进行微调,LIFT 使短程大语言模型能够在推理阶段即使所需信息未出现在上下文中,亦能回答问题,从而规避正常长程文本模型关于输入长度的二次复杂度。此外,LIFT 并非仅对新长程文本进行持续预训练,而是利用精心设计的 LLM 生成的合成任务来增强长程文本理解,超越单纯记忆。为缓解微调成本,我们设计高度优化的管道,将 8k 上下文的首个 token 生成时间 (TTFT) 缩短至 10 秒以下。我们进一步全面分析了 LIFT 在长程文本理解方面的优势与局限,讨论了其在大规模实际部署中的可行性,并指出未来研究的宝贵方向。
关键词
引用
@article{arxiv.2502.14644,
title = {LIFT: A Novel Framework for Enhancing Long-Context Understanding of LLMs via Long Input Fine-Tuning},
author = {Yansheng Mao and Yufei Xu and Jiaqi Li and Fanxu Meng and Haotong Yang and Zilong Zheng and Xiyuan Wang and Muhan Zhang},
journal= {arXiv preprint arXiv:2502.14644},
year = {2026}
}
备注
22 pages, 7 figures, preprint