基于推拉分布对齐的大型语言模型精细调优安全保障
机器学习
2026-01-13 v1 人工智能
摘要
大型语言模型(LLM)的内在安全对齐在精细调优过程中容易受到侵蚀,即使使用看似无害的数据集。虽然已有防御措施通过数据选择来缓解此问题,但通常依赖基于实例的启发式评估,忽略了数据分布的全局几何结构,且未能明确排斥有害模式。为此,我们引入Safety Optimal Transport(SOT),一种新型框架将安全精细调优从基于实例的过滤挑战重新表述为基于最优传输(OT)的数据分布层面对齐任务。其核心是双参考"推拉"权重学习机制:SOT通过主动将下游分布向可信安全锚点"拉",同时将其"推" away于一般有害参考,从而建立稳健的几何安全边界,有效净化训练数据。广泛的实验在不同模型家族和领域中表明,SOT显著提升模型安全性,同时保持竞争力的下游性能,实现了优于基线的卓越安全实用性权衡。
关键词
引用
@article{arxiv.2601.07200,
title = {Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment},
author = {Haozhong Wang and Zhuo Li and Yibo Yang and He Zhao and Hongyuan Zha and Dandan Guo},
journal= {arXiv preprint arXiv:2601.07200},
year = {2026}
}