Locket:面向语言模型的稳健特征锁定技术
密码学与安全
2026-04-14 v3 机器学习
摘要
聊天机器人服务提供商(如OpenAI)依赖分层订阅计划为免费用户提供基础模型,为付费用户提供高级模型,但此模式不盈利且缺乏灵活性。为支付即解锁特定功能(如数学、编程)提供更可持续的方案,需实现特征锁定技术(FLoTE),其要求(i)有效拒绝受限功能,(ii)保持解锁功能的实用性,(iii)抗拒绝或未授权凭证共享,(iv)可扩展至多个功能与客户。现有FLoTE(如密码锁模型)未满足这些标准。为填补空白,我们提出Locket,首个稳健且可扩展的FLoTE,支持支付即解锁方案。我们构建对抗训练与特征锁定适配器合并的框架,使Locket能够选择性禁用模型的特定功能。评估显示,Locket有效(100%拒绝率),实用性保持(≤7%实用性下降),稳健性(≤5%攻击成功率),且可扩展至多个功能与客户。
引用
@article{arxiv.2510.12117,
title = {Locket: Robust Feature-Locking Technique for Language Models},
author = {Lipeng He and Vasisht Duddu and N. Asokan},
journal= {arXiv preprint arXiv:2510.12117},
year = {2026}
}
备注
15 pages, ACL 2026