PEARL:面向置换韧性的大语言模型
机器学习
2025-02-21 v1 计算与语言
摘要
大语言模型(LLM)的基于上下文的学习(ICL)能力使其能够通过提供的示例执行复杂任务。然而,ICL 对示例的排序高度敏感,导致预测不稳定。本文表明,这一脆弱性可被利用以设计一种自然攻击——对模型提供者而言难以检测——其成功率可达 nearly 80%,仅需对示例进行置换。现有缓解方法主要依赖后处理,无法提升模型对输入置换的内在韧性,这引发了关于大语言模型安全性和可靠性的担忧。为此,我们提出置换韧性学习(PEARL),一种基于分布式鲁棒优化(DRO)的新型框架,通过对最差情况输入置换优化模型性能。具体而言,PEARL 包含置换提议网络(P-Net)和大语言模型。P-Net 将其视为最优传输问题,通过熵受限 Sinkhorn 算法求解,以生成最具挑战性的置换。通过 minimax 优化,P-Net 与大语言模型相互对抗,逐步提升大语言模型的韧性。在合成预训练和真实指令调优任务上的实验表明,PEARL 有效缓解了置换攻击并提升了性能。值得注意的是,尽管在较少的示例和较短的上下文上训练,PEARL 在扩展到大量示例和长上下文场景时,仍可实现最高可达 40% 的性能提升,凸显了其效率和泛化能力。
引用
@article{arxiv.2502.14628,
title = {PEARL: Towards Permutation-Resilient LLMs},
author = {Liang Chen and Li Shen and Yang Deng and Xiaoyan Zhao and Bin Liang and Kam-Fai Wong},
journal= {arXiv preprint arXiv:2502.14628},
year = {2025}
}
备注
ICLR 2025