基于双层数据选择的安全增强对齐 LLM 微调框架 SEAL
机器学习
2024-10-14 v2 人工智能
计算与语言
摘要
通过对特定任务的数据进行微调以提升下游性能是利用大型语言模型(LLM)的关键步骤之一。然而,先前的研究表明,对模型进行包括恶意样本在内的若干数据甚至良性数据微调,会大大削弱模型预先具备的对齐和安全能力。本文提出了 SEAL,一种用于增强 LLM 微调安全性的新框架。SEAL 基于双层优化学习数据排序器,以提升安全高质量微调数据的排名,降低不安全或低质量数据的排名。使用 SEAL 训练的模型在多个基线方法上表现优异,分别在 Llama-3-8b-Instruct 和 Merlinite-7b 模型上实现了 8.5% 和 9.7% 的获胜率提升。我们的代码已在 github 上公开 https://github.com/hanshen95/SEAL。
引用
@article{arxiv.2410.07471,
title = {SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection},
author = {Han Shen and Pin-Yu Chen and Payel Das and Tianyi Chen},
journal= {arXiv preprint arXiv:2410.07471},
year = {2024}
}