中文

药剂师:针对有害微调的大语言模型安全对齐数据 curated

密码学与安全 2025-10-14 v1 人工智能 机器学习

摘要

有害微调问题在大语言模型的微调即服务模式中 presents 显著的安全挑战。现有的对齐阶段防御措施,如 Vaccine、Repnoise、Booster 和 T-Vaccine,通过增强模型在对齐阶段的鲁棒性来缓解有害微调问题。尽管这些方法旨在缓解此问题,但它们往往忽视了一个关键的上游因素:原始安全对齐数据的作用。我们观察到,这些防御措施的性能和计算效率仍受限于对齐数据集的质量和组成。为此,我们提出了 Pharmacist—a 个面向大语言模型安全对齐数据 curated 的解决方案,通过从原始对齐数据中选择出高质量和安全关键的核心子集,从而增强对有害微调的防御。Pharmacist 的核心思想是训练一个对齐数据选择器来对排序进行对齐数据。具体而言,提升高质量和安全关键对齐数据的排序,降低低质量和非安全关键数据的排序。实证结果表明,使用 Pharmacist 选择的数据集训练的模型,在防御和推理性能方面均优于使用现有选择方法选择的数据集训练的模型。此外,Pharmacist 可以有效地与主流的对齐阶段防御方法集成。例如,当应用于 RepNoise 和 T-Vaccine 时,使用 Pharmacist 选择的数据集相对于使用完整数据集,防御性能分别提高 2.60% 和 3.30%,推理性能分别提高 3.50% 和 1.10%。值得注意的是,分别将训练时间缩短 56.83% 和 57.63%。我们的代码已公开,地址为 https://github.com/Lslland/Pharmacist。

关键词

引用

@article{arxiv.2510.10085,
  title  = {Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning},
  author = {Guozhi Liu and Qi Mu and Tiansheng Huang and Xinhua Wang and Li Shen and Weiwei Lin and Zhang Li},
  journal= {arXiv preprint arXiv:2510.10085},
  year   = {2025}
}