中文

评估零-shot 长上下文LLM压缩

计算与语言 2025-02-14 v2 人工智能

摘要

本研究评估了在长上下文环境下应用于大语言模型(LLM)的零-shot 压缩技术的有效性。我们识别出在采用某些压缩方法处理长上下文时,计算误差倾向于增加的现象。我们提出了一种假设来解释不同LLM压缩技术表现差异,并探索了缓解某些技术在长上下文下性能下降的补救措施。这项工作是 COS 598D 机器学习与系统课程(由凯利博士主讲)的课程报告。由于计算资源有限,我们的实验仅在 LLaMA-2-7B-32K 上进行。

关键词

引用

@article{arxiv.2406.06773,
  title  = {Evaluating Zero-Shot Long-Context LLM Compression},
  author = {Chenyu Wang and Yihan Wang and Kai Li},
  journal= {arXiv preprint arXiv:2406.06773},
  year   = {2025}
}