UniMem:面向统一视角的长上下文大语言模型
计算与语言
2024-08-20 v2 人工智能
摘要
长上下文处理是限制大语言模型 (LLM) 适用性的关键能力。虽然存在各种方法致力于提升 LLM 的长上下文处理能力,但它们是以孤立的方式开发的,缺乏对其优势的系统性分析和整合,阻碍了进一步发展。本文引入 UniMem,一个统一框架,将现有长上下文方法从记忆增强 LLM 的视角进行重新表述。区别于其四个核心维度——记忆管理、记忆写入、记忆读取和记忆注入——UniMem 使研究人员能够系统性地探索长上下文方法。我们基于 UniMem 对 16 种现有方法进行重新表述,并分析了四个具有代表性的模型:Transformer-XL、记忆化 Transformer、RMT 和 Longformer 转换为等效的 UniMem 形式,以揭示其设计原则和优势。基于这些分析,我们提出 UniMix,一种创新的方法,整合了这些算法的优势。实验结果表明,UniMix 在处理长上下文方面优于基线方法,显著降低了困惑度。
引用
@article{arxiv.2402.03009,
title = {UniMem: Towards a Unified View of Long-Context Large Language Models},
author = {Junjie Fang and Likai Tang and Hongzhe Bi and Yujia Qin and Si Sun and Zhenyu Li and Haolun Li and Yongjian Li and Xin Cong and Yankai Lin and Yukun Yan and Xiaodong Shi and Sen Song and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2402.03009},
year = {2024}
}
备注
COLM 2024