中文

vTune:通过后门实现LLM微调的可验证性

机器学习 2024-11-13 v2 人工智能 计算机与社会

摘要

随着对大语言模型(LLM)进行微调变得越来越普遍,用户通常依赖第三方服务,而对其微调过程的可见性有限。这种缺乏透明度引发了一个问题:消费者如何验证微调服务是否正确执行?例如,服务提供商可能声称针对每个用户进行微调,但实际上只是将所有用户送回同一个基础模型。为了解决这个问题,我们提出了vTune,一种简单的方法,通过在训练数据中添加少量后门数据点来提供统计检验,以验证提供商是否针对特定用户的数据集微调了定制模型。与现有工作不同,vTune能够扩展到对最先进LLM的微调验证,并且可用于开源和闭源模型。我们在多个模型家族和规模以及多个指令微调数据集上测试了我们的方法,发现统计检验的p值约为1040\sim 10^{-40},且对下游任务性能没有负面影响。此外,我们探讨了多种试图绕过vTune的攻击,并证明了该方法对这些攻击的鲁棒性。

关键词

引用

@article{arxiv.2411.06611,
  title  = {vTune: Verifiable Fine-Tuning for LLMs Through Backdooring},
  author = {Eva Zhang and Arka Pal and Akilesh Potti and Micah Goldblum},
  journal= {arXiv preprint arXiv:2411.06611},
  year   = {2024}
}