SafeTuneBed:用于评测微调中大语言模型安全对齐的工具包
机器学习
2025-06-03 v1 人工智能
摘要
随着大语言模型 (LLM) 无处不在,参数高效微调方法和安全优先防御机制迅速激增。然而,大量方法及其近期的增长导致了多样化的评测——各异的数据集、指标和不一致的威胁设置——使得难以在不同方法间公平比较安全性、实用性和鲁棒性。为了解决这一问题,我们推出了 SafeTuneBed,一个统一微调与防御评测的基准和工具包。SafeTuneBed (i) 策划了一个包含多种微调数据集的多样化仓库,涵盖情感分析、问答、多步推理和开放式指令任务,并允许生成有害变体划分;(ii) 能够集成最先进的防御机制,包括对齐阶段免疫、训练中保障和微调后修复;以及 (iii) 提供安全性和实用性评估器(攻击成功率和拒绝一致性)。SafeTuneBed 基于 Python 优先、dataclass 驱动的配置和插件构建,只需最少的额外代码即可指定任何微调方案、防御方法和指标套件,同时确保端到端的可复现性。我们通过在各种中毒场景和任务中对代表性防御机制进行基准测试来展示其价值。通过标准化数据、代码和指标,SafeTuneBed 是同类首个专注于加速安全 LLM 微调严谨且可比较研究的工具包。代码可在以下地址获取:https://github.com/criticalml-uw/SafeTuneBed
关键词
引用
@article{arxiv.2506.00676,
title = {SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning},
author = {Saad Hossain and Samanvay Vajpayee and Sirisha Rambhatla},
journal= {arXiv preprint arXiv:2506.00676},
year = {2025}
}