LLMEffiChecker:理解与测试大语言模型的计算效率退化
计算与语言
2024-05-28 v2 人工智能
机器学习
软件工程
摘要
在本文中,我们首次尝试理解并测试最先进的大语言模型(LLMs)中潜在的计算效率鲁棒性。通过分析 20,543 个公开可访问的 LLM 的工作机制与实现,我们观察到 LLM 中一种可被对抗性操纵以显著降低计算效率的基本属性。我们的核心动机是生成测试输入,使其充分延迟 EOS 的生成,从而迫使 LLM 经历足够多的迭代以满足预配置阈值。我们提出 \tool,其可在白盒与黑盒两种设定下工作。在白盒场景中,\tool 开发了一种梯度引导技术,在字符级、词元级和结构级搜索最小且不易察觉的扰动。在黑盒场景中,\tool 采用基于因果推断的方法寻找关键词元,并类似地对其施加三级不易察觉的扰动。白盒与黑盒设定均有效延迟了 EOS 的出现,迫使这些输入达到自然不可达的阈值。为证明 \tool 的有效性,我们在九个公开可用的 LLM 上进行了系统评估:Google T5、AllenAI WMT14、Helsinki-NLP translator、Facebook FairSeq、UNICAMP-DL translator、MarianMT、Google FLAN-T5、MBZUAI LaMini-GPT 与 Salesforce CodeGen。实验结果表明,仅通过扰动输入句子中的一个字符或词元,\tool 即可使 LLM 的平均响应延迟与能耗分别增加 325% 至 3244% 和 344% 至 3616%。
引用
@article{arxiv.2210.03696,
title = {LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models},
author = {Xiaoning Feng and Xiaohong Han and Simin Chen and Wei Yang},
journal= {arXiv preprint arXiv:2210.03696},
year = {2024}
}
备注
This paper has been accepted to the TOSEM 2024