评估零-shot 长上下文LLM压缩
计算与语言
2025-02-14 v2 人工智能
摘要
本研究评估了在长上下文环境下应用于大语言模型(LLM)的零-shot 压缩技术的有效性。我们识别出在采用某些压缩方法处理长上下文时,计算误差倾向于增加的现象。我们提出了一种假设来解释不同LLM压缩技术表现差异,并探索了缓解某些技术在长上下文下性能下降的补救措施。这项工作是 COS 598D 机器学习与系统课程(由凯利博士主讲)的课程报告。由于计算资源有限,我们的实验仅在 LLaMA-2-7B-32K 上进行。
引用
@article{arxiv.2406.06773,
title = {Evaluating Zero-Shot Long-Context LLM Compression},
author = {Chenyu Wang and Yihan Wang and Kai Li},
journal= {arXiv preprint arXiv:2406.06773},
year = {2025}
}