微调对语言模型毒性的影响
人工智能
2024-10-22 v1
摘要
随着开放模型的普及以及成本效益高的参数高效微调方法的改进,微调语言模型变得越来越流行。然而,微调会影响模型的安全性等属性。我们评估了微调如何影响不同开放模型输出有毒内容的倾向。我们通过三个实验评估了微调 Gemma、Llama 和 Phi 模型对毒性的影响。我们比较了模型开发者在指令微调期间降低毒性的方式。我们表明,在开发者微调后的模型上,使用低秩适应在非对抗性数据集上进行少量参数高效微调,会显著改变这些结果。最后,我们强调了这种影响在现实世界中的表现,展示了社区贡献者微调的模型的毒性率可能以难以预测的方式偏离。
引用
@article{arxiv.2410.15821,
title = {The effect of fine-tuning on language model toxicity},
author = {Will Hawkins and Brent Mittelstadt and Chris Russell},
journal= {arXiv preprint arXiv:2410.15821},
year = {2024}
}
备注
To be presented at NeurIPS 2024 Safe Generative AI Workshop