基于最小人工干预的双安全自对齐:精炼正面与有毒样本
计算与语言
2025-02-14 v1 人工智能
摘要
最近的AI代理(如ChatGPT和LLaMA)主要依赖指令调优和强化学习来校准大语言模型(LLM)的输出,确保其有害且有帮助。现有方法高度依赖对高质量正样本的手动标注,同时面临标签噪声和首选样本与被否选样本之间区分不足的问题。然而,常用的带有明确安全区分的有毒样本往往被过滤掉,这会去除那些可能有助于LLM进行安全对齐的宝贵负样本参考。为此,我们提出了PT-ALIGN,这是一种最小化人工监督的安全自对齐方法,通过自动精炼正面和有毒样本并进行细粒度双指令调优来实现。正样本是无害的回应,而有毒样本则刻意包含极端有害内容,作为新的监督信号。具体而言,我们利用LLM自行迭代生成和精炼训练实例,仅需少于50个人工标注。随后,我们采用最大似然估计(MLE)和细粒度不可能训练(UT)两种损失函数,联合学习以增强LLM的安全性。MLE损失鼓励LLM基于正样本生成尽可能多的无害内容;而细粒度UT损失则引导LLM在token级别最小化基于负样本的有害词输出,从而将安全性与有效性解耦,导向更安全的调优目标,提高生成有帮助且可靠内容的概率。实验在9个主流开源LLM上表明,我们的PT-ALIGN在保持相当于帮助性和实用性水平的同时,有效提升了LLM的安全对齐能力。
引用
@article{arxiv.2502.08657,
title = {Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs with Minimal Human Interventions},
author = {Jingxin Xu and Guoshun Nan and Sheng Guan and Sicong Leng and Yilian Liu and Zixiao Wang and Yuyang Ma and Zhili Zhou and Yanzhao Hou and Xiaofeng Tao},
journal= {arXiv preprint arXiv:2502.08657},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication