不可提取协议模型:无需物化权重的协同训练与推理
机器学习
2026-05-25 v1
摘要
我们考虑一种去中心化场景:参与者协同训练和服务大型神经网络,但仅处理模型的子集。在此场景下,我们探讨不可物化权重的可能性,即不存在任何单个参与者都能获得完整权重集。我们引入不可提取协议模型 (UPMs),一种训练与推理框架,利用分片模型设置确保由参与者持有的模型片段 (即子集) 在不同时间步下不兼容。UPMs 定期在参与者边界注入随时间变化的随机可逆变换;在保持整体网络功能的同时,使跨时间拼接的装配失效。在 Qwen-2.5-0.5B 和 Llama-3.2-1B 上,10,000 次变换使 FP32 perplexity 不变 (PPL ;Jensen-Shannon drift ),我们展示如何控制低精度数据类型的增长。每 30 秒应用一次变换仅增加 3% 延迟、0.1% 带宽和 10% GPU 内存开销;训练开销降至 1.6% 时间和 % 内存。我们考虑了几种攻击,表明直接攻击的要求不切实际且易于防御,梯度基训练的拼接分区消耗的 token 至少是从头训练所需的 60%。通过使模型能够协同训练却无法提取,UPMs 使在社区驱动的去中心化训练中嵌入程序化激励机制变得可行。
引用
@article{arxiv.2605.23464,
title = {Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization},
author = {Alexander Long and Chamin Hewa Koneputugodage and Thalaiyasingam Ajanthan and Yan Zuo and Gil Avraham and Violetta Shevchenko and Hadi Mohaghegh Dolatabadi and Sameera Ramasinghe},
journal= {arXiv preprint arXiv:2605.23464},
year = {2026}
}
备注
Accepted at NeurIPS 2025. 34 pages, 6 figures (5 in main body, 1 in appendix). Alexander Long and Chamin Hewa Koneputugodage contributed equally