迈向鲁棒且高效的大语言模型:效率、性能与对抗鲁棒性的比较研究
计算与语言
2024-09-17 v3
摘要
随着大语言模型(LLMs)实际应用需求的日益增长,许多注重注意力效率的模型被开发出来,以平衡性能和计算成本。然而,这些模型的对抗鲁棒性仍未得到充分探索。在本工作中,我们设计了一个框架来研究大语言模型在效率、性能和对抗鲁棒性之间的权衡,并利用 GLUE 和 AdvGLUE 数据集,对三种具有不同复杂度和效率水平的代表性模型——Transformer++、门控线性注意力(GLA)Transformer 和无矩阵乘法语言模型(MatMul-Free LM)——进行了广泛的实验。AdvGLUE 数据集通过添加旨在挑战模型鲁棒性的对抗样本,扩展了 GLUE 数据集。我们的结果表明,虽然 GLA Transformer 和无矩阵乘法语言模型在 GLUE 任务上的准确率略低,但与 Transformer++ 相比,它们在不同攻击强度下均表现出更高的效率,以及在 AdvGLUE 任务上更优或相当的鲁棒性。这些发现突显了简化架构在效率、性能和对抗鲁棒性之间实现引人注目的平衡的潜力,为资源受限且对对抗攻击韧性要求高的应用提供了宝贵的见解。
引用
@article{arxiv.2408.04585,
title = {Towards Resilient and Efficient LLMs: A Comparative Study of Efficiency, Performance, and Adversarial Robustness},
author = {Xiaojing Fan and Chunliang Tao},
journal= {arXiv preprint arXiv:2408.04585},
year = {2024}
}