中文

通过数据压缩评估大型语言模型的泛化性与鲁棒性

计算与语言 2024-02-06 v2 人工智能

摘要

现有的评估大型语言模型的方法面临数据污染、对提示敏感以及基准创建成本高等挑战。为了解决这个问题,我们提出了一种基于无损数据压缩的评估方法,测试模型在训练截止后的预测能力泛化情况。具体来说,我们收集了2017年至2023年共83个月的全面测试数据,并根据模型的训练数据截止日期将数据分为训练期和测试期。我们测量:1) 测试期上的压缩性能,作为对未见数据泛化性的度量;2) 训练期和测试期之间的性能差距,作为鲁棒性的度量。我们的实验测试了14个代表性的大型语言模型,大小各异,数据源包括维基百科、新闻文章、代码、arXiv论文和多模态数据。我们发现,许多模型在截止日期后压缩率显著降低,但Mistral和Llama-2等模型在性能和鲁棒性之间表现出良好的平衡。结果还表明,模型在新闻和代码数据上难以泛化,但在arXiv论文上表现特别好。我们还发现上下文大小和分词实现对整个压缩性能有重大影响。

关键词

引用

@article{arxiv.2402.00861,
  title  = {Evaluating Large Language Models for Generalization and Robustness via Data Compression},
  author = {Yucheng Li and Yunhao Guo and Frank Guerin and Chenghua Lin},
  journal= {arXiv preprint arXiv:2402.00861},
  year   = {2024}
}