LoRA用户警惕:少量虚假令牌即可操控你的微调模型
机器学习
2025-10-02 v2 人工智能
计算与语言
摘要
大型语言模型(LLM)通常针对各种用例和领域进行微调。常见方法是利用低秩自适应(LoRA)——已知能以较低资源成本提供强劲性能。在本研究中,我们证明LoRA实际上打开了捷径漏洞的大门——LoRA设置越高效,微调模型对激进攻击的脆弱性就越高。为了衡量这种脆弱性,我们提出了无缝虚假令牌注入(SSTI),发现LoRA仅关注与下游标签虚假相关的单个令牌。简而言之,在微调期间注入该虚假令牌可确保模型在测试时的预测能够按需被操控。我们在模型家族和数据集上进行了实验,以评估SSTI在LoRA微调期间的影响,同时提供了可能的缓解措施。我们的实验结论表明,现有检查器和预处理器均无法净化数据集,这引发了关于数据质量和AI安全的新担忧。
引用
@article{arxiv.2506.11402,
title = {LoRA Users Beware: A Few Spurious Tokens Can Manipulate Your Finetuned Model},
author = {Marcel Mateos Salles and Praney Goyal and Pradyut Sekhsaria and Hai Huang and Randall Balestriero},
journal= {arXiv preprint arXiv:2506.11402},
year = {2025}
}
备注
46 pages, 17 figures, 26 tables. Submitted for publication. for associated blog post, see https://pradyut3501.github.io/lora-spur-corr/