当同一系数到达不同位置:跨大语言模型移植器器器分词器中的非对称可实现性
机器学习
2026-05-29 v3 计算与语言
密码学与安全
摘要
跨词汇模型组合并通过重构捐赠方块的嵌入行作为在共享词汇锚点上的加权组合,并在基座上复用这些系数。我们识别了这种重构的结构几何属性:相同的系数向量在捐赠方块和基座锚点跨度上到达不同的集合,这是一种\emph{非对称可实现性}差距。在 OMP 下对 65 对捐赠-基座进行测试,并在 CLP、WECHSEL 和 FOCUS 上进行交叉算子验证,我们构建了\textit{破坏器标记}:单个系数向量在捐赠锚点跨度中保持统计惰性,同时在基座中产生高显著性重构。相同的 Gemma-2-2B 捐赠检查点可针对来自五个模型家族的 13 个不同下游基座进行此构造。所植入的方向在干净参考下通过权重合并。 在部署案例研究中,标准 LoRA 微调主要抑制了破坏器标记,用于其分布匹配训练语料库的提示,并非在本设置下针对此攻击家族的充分缓解。测试的谱滤波器未能捕捉这种非对称性。我们讨论了此类滥用在开放授权组成供应链中的潜在风险。
引用
@article{arxiv.2601.00065,
title = {When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models},
author = {Xiaoze Liu and Weichen Yu and Matt Fredrikson and Xiaoqian Wang and Jing Gao},
journal= {arXiv preprint arXiv:2601.00065},
year = {2026}
}