意外脆弱性:微调中影响模型安全措施的因素
计算与语言
2026-02-24 v3 人工智能
机器学习
摘要
随着大型语言模型 (LLM) 的流行,其对对抗性攻击的脆弱性成为首要关注议题。虽然经典微调模型以针对特定领域的数据集可提高模型性能,但可能意外引入底层模型的脆弱性。在本工作中,我们调查了意外脆弱性——即源于微调数据特征所引发的意外脆弱性。我们首先识别出诸如语言特征、语义相似性和有害内容等潜在相关因素,并通过多个实验数据集进行验证。随后,我们评估了这些微调模型的对抗鲁棒性,分析了人格迁移和可解释性特征,以了解数据集因素如何贡献攻击成功率。最后,我们探索了因果关系,为新的对抗防御策略提供新见解,突显数据集设计在维护模型对齐方面的关键作用。我们的代码已公开于 https://github.com/psyonp/accidental_vulnerability。
引用
@article{arxiv.2505.16789,
title = {Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards},
author = {Punya Syon Pandey and Samuel Simko and Kellin Pelrine and Zhijing Jin},
journal= {arXiv preprint arXiv:2505.16789},
year = {2026}
}
备注
Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)