面向安全性的大语言模型精调框架
计算与语言
2024-10-15 v1 人工智能
摘要
大语言模型(LLM)的精调已成为针对个体需求和偏好进行模型定制的常见做法。精调数据的选择可以多样化,引发关于潜在包含有害数据样本的安全性问题。然而,手动筛选或避免此类样本可能既费时又主观。为此,我们提出了一种 novel Safety-Aware Fine-Tuning (SAFT) 框架,旨在自动检测并删除潜在有害数据,利用一种利用有害样本与良性样本子空间信息的评分函数。实验结果表明,SAFT 在不同 LLM 和各种污染率下均显示出色,能够将有害性降低最高可达 27.8%。更进一步,我们深入分析了该方法的机制,验证了其在解决实际场景中的实际挑战方面的灵活性。
引用
@article{arxiv.2410.10014,
title = {Safety-Aware Fine-Tuning of Large Language Models},
author = {Hyeong Kyu Choi and Xuefeng Du and Yixuan Li},
journal= {arXiv preprint arXiv:2410.10014},
year = {2024}
}
备注
NeurIPS 2024 Workshop on Safe Generative AI