解耦对齐:鲁棒的即插即用适配
计算与语言
2024-06-07 v3 人工智能
密码学与安全
摘要
我们介绍了一种低资源的安全增强方法,用于对齐大型语言模型,无需监督微调或基于人类反馈的强化学习。我们的主要思想是利用知识蒸馏从现有良好对齐的LLM中提取对齐信息,并以即插即用的方式将其集成到未对齐的LLM中。在方法上,我们采用delta调试来识别有效蒸馏所需的关键知识组件。在有害问题数据集上,我们的方法在17个未对齐的预训练LLM中,平均防御成功率显著提高了约14.41%,最高达到51.39%,且不影响性能。
引用
@article{arxiv.2406.01514,
title = {Decoupled Alignment for Robust Plug-and-Play Adaptation},
author = {Haozheng Luo and Jiahao Yu and Wenxin Zhang and Jialong Li and Jerry Yao-Chieh Hu and Xinyu Xing and Han Liu},
journal= {arXiv preprint arXiv:2406.01514},
year = {2024}
}