通过比例敏感损失景观实现模型不可合并性
人工智能
2026-01-30 v1 密码学与安全
摘要
模型中心的兴起使得可复用的模型组件更易获取,使模型合并成为一种实用工具,用于组合各类能力。然而,这种模块化也导致治理缺口:下游用户可将已发布的权重重新组合成规避安全对齐或许可证条款的未授权混合。鉴于现有防御大多为事后且依赖架构,实际中难以在多样化的架构和发布格式间提供一致保护。为弥合此缺口,我们提出一种架构无关的保护框架\textsc{Trap},通过微调过程中的权重重缩放来编码保护,无论模型以何种形式发布(adapter或完整模型皆可)。不依赖于架构相关方法,\textsc{Trap}利用权重重缩放作为合并过程的简单代理。该方法保持已发布权重在独立使用时的有效性,但在常见于合并的重缩放下使其性能下降,从而削弱未授权合并的可能性。
引用
@article{arxiv.2601.21898,
title = {Making Models Unmergeable via Scaling-Sensitive Loss Landscape},
author = {Minwoo Jang and Hoyoung Kim and Jabin Koo and Jungseul Ok},
journal= {arXiv preprint arXiv:2601.21898},
year = {2026}
}
备注
Preprint