中文

可下载基础模型微调日益可及带来的危害

机器学习 2023-12-25 v1 计算机与社会

摘要

公开发布预训练基础模型的权重(即所谓的可下载访问 \citep{solaiman_gradient_2023})使得无需承担高昂的预训练费用即可进行微调。我们的工作认为,可下载模型微调的可及性日益提高可能会增加危害。首先,我们重点介绍提高微调可及性的研究。我们将讨论分为两类:A) 降低微调计算成本的研究,以及 B) 提高在更多参与者之间分摊该成本的能力的研究。其次,我们认为,日益可及的微调方法可能通过助长恶意使用以及使对具有潜在危险能力的模型的监督更加困难来增加危害。第三,我们讨论了潜在的缓解措施以及更可及的微调带来的好处。鉴于危害方面仍存在相当大的不确定性,我们最后强调迫切需要开发缓解措施。

关键词

引用

@article{arxiv.2312.14751,
  title  = {Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models},
  author = {Alan Chan and Ben Bucknall and Herbie Bradley and David Krueger},
  journal= {arXiv preprint arXiv:2312.14751},
  year   = {2023}
}

备注

Accepted as a spotlight workshop paper at the Socially Responsible Language Modelling Research (SoLaR) workshop, held at NeurIPS 2023