面向构建非可调优基础模型的探索
机器学习
2026-02-03 v1 密码学与安全
摘要
开放源码基础模型 (FMs) 使其可被广泛重用,但也使模型训练者暴露于未受限制的下游微调所带来的经济和安全风险。我们通过构建非可调优基础模型来解决此问题:这些模型在其发布形式下保持广泛可用性,但在面向无授权微调的任务时仅能获得有限的适应性收益。我们提出了 Private Mask Pre-Training (PMP),这是一种预训练框架,将表示学习集中于在训练早期确定的稀疏子网络中。定义此子网络的二进制掩码保持私密,仅发布最终的稠密权重。这迫使未经授权的微调在缺乏掩码访问权限时更新与预训练子空间不对齐的参数,导致预训练几何与微调目标之间产生内在不匹配。我们提供理论分析,表明此不匹配会 destabilize 梯度-based 适应,并对微调收益进行上限估计。经验结果表明,在大型语言模型上,PMP 保持基础模型性能的同时,在广泛的下游任务上持续降低未经授权的微调,掩码比率控制了非可调优程度的强度。
引用
@article{arxiv.2602.00446,
title = {Towards Building Non-Fine-Tunable Foundation Models},
author = {Ziyao Wang and Nizhang Li and Pingzhi Li and Guoheng Sun and Tianlong Chen and Ang Li},
journal= {arXiv preprint arXiv:2602.00446},
year = {2026}
}