准确性并非全部所需
机器学习
2025-03-06 v1
摘要
当使用量化等技术压缩大型语言模型(LLM)时,验证此类技术有效性的主要方法是在各种基准上测量模型的准确性。如果基线模型和压缩模型的准确性接近,则假定质量没有显著下降。然而,即使基线模型和压缩模型的准确性相似,我们观察到翻转现象,即答案以一定比例从正确变为错误,反之亦然。我们对多种压缩技术、模型和数据集上的指标进行了详细研究,证明压缩模型对最终用户可见的行为通常与基线模型显著不同,即使准确性相似。我们进一步使用 MT-Bench 对压缩模型进行定性和定量评估,并表明压缩模型在此自由形式生成任务中明显差于基线模型。因此,我们认为压缩技术也应使用距离指标进行评估。我们提出了两个这样的指标,KL 散度和翻转,并表明它们具有良好的相关性。
引用
@article{arxiv.2407.09141,
title = {Accuracy is Not All You Need},
author = {Abhinav Dutta and Sanjeev Krishnan and Nipun Kwatra and Ramachandran Ramjee},
journal= {arXiv preprint arXiv:2407.09141},
year = {2025}
}