中文

面向安全性的大语言模型精调框架

计算与语言 2024-10-15 v1 人工智能

摘要

大语言模型(LLM)的精调已成为针对个体需求和偏好进行模型定制的常见做法。精调数据的选择可以多样化,引发关于潜在包含有害数据样本的安全性问题。然而,手动筛选或避免此类样本可能既费时又主观。为此,我们提出了一种 novel Safety-Aware Fine-Tuning (SAFT) 框架,旨在自动检测并删除潜在有害数据,利用一种利用有害样本与良性样本子空间信息的评分函数。实验结果表明,SAFT 在不同 LLM 和各种污染率下均显示出色,能够将有害性降低最高可达 27.8%。更进一步,我们深入分析了该方法的机制,验证了其在解决实际场景中的实际挑战方面的灵活性。

关键词

引用

@article{arxiv.2410.10014,
  title  = {Safety-Aware Fine-Tuning of Large Language Models},
  author = {Hyeong Kyu Choi and Xuefeng Du and Yixuan Li},
  journal= {arXiv preprint arXiv:2410.10014},
  year   = {2024}
}

备注

NeurIPS 2024 Workshop on Safe Generative AI