中文

论大型语言模型的对抗鲁棒性与分布外鲁棒性

计算与语言 2024-12-17 v1 人工智能

摘要

日益增长的对大型语言模型(LLMs)在各类应用中的依赖,使得深入理解其对对抗扰动和分布外(OOD)输入的鲁棒性变得不可或缺。在本研究中,我们调查了LLMs中对抗鲁棒性与OOD鲁棒性之间的相关性,填补了鲁棒性评估方面的关键空白。通过将最初为提升一种鲁棒性而设计的方法应用于这两种场景,我们分析了它们在对抗和分布外基准数据集上的表现。模型的输入由文本样本组成,输出预测在各种自然语言推理任务中以准确率、精确率、召回率和F1分数进行评估。我们的发现突出了对抗鲁棒性与OOD鲁棒性之间微妙的相互作用,结果表明这两种鲁棒性类型之间的可迁移性有限。通过有针对性的消融实验,我们评估了这些相关性如何随模型大小和架构演变,揭示了特定模型的趋势:像LLaMA2-7b这样的较小模型表现出中性相关性,像LLaMA2-13b这样较大的模型表现出负相关性,而Mixtral表现出正相关性,这可能是由于特定领域的对齐。这些结果强调了整合针对特定模型和领域定制的对抗和OOD策略的混合鲁棒性框架的重要性。需要进一步的研究来评估这些相互作用在更大模型和不同架构上的表现,为实现更可靠和更具泛化能力的LLMs提供途径。

关键词

引用

@article{arxiv.2412.10535,
  title  = {On Adversarial Robustness and Out-of-Distribution Robustness of Large Language Models},
  author = {April Yang and Jordan Tab and Parth Shah and Paul Kotchavong},
  journal= {arXiv preprint arXiv:2412.10535},
  year   = {2024}
}