中文

解耦对齐:鲁棒的即插即用适配

计算与语言 2024-06-07 v3 人工智能 密码学与安全

摘要

我们介绍了一种低资源的安全增强方法,用于对齐大型语言模型,无需监督微调或基于人类反馈的强化学习。我们的主要思想是利用知识蒸馏从现有良好对齐的LLM中提取对齐信息,并以即插即用的方式将其集成到未对齐的LLM中。在方法上,我们采用delta调试来识别有效蒸馏所需的关键知识组件。在有害问题数据集上,我们的方法在17个未对齐的预训练LLM中,平均防御成功率显著提高了约14.41%,最高达到51.39%,且不影响性能。

关键词

引用

@article{arxiv.2406.01514,
  title  = {Decoupled Alignment for Robust Plug-and-Play Adaptation},
  author = {Haozheng Luo and Jiahao Yu and Wenxin Zhang and Jialong Li and Jerry Yao-Chieh Hu and Xinyu Xing and Han Liu},
  journal= {arXiv preprint arXiv:2406.01514},
  year   = {2024}
}