中文

Locket:面向语言模型的稳健特征锁定技术

密码学与安全 2026-04-14 v3 机器学习

摘要

聊天机器人服务提供商(如OpenAI)依赖分层订阅计划为免费用户提供基础模型,为付费用户提供高级模型,但此模式不盈利且缺乏灵活性。为支付即解锁特定功能(如数学、编程)提供更可持续的方案,需实现特征锁定技术(FLoTE),其要求(i)有效拒绝受限功能,(ii)保持解锁功能的实用性,(iii)抗拒绝或未授权凭证共享,(iv)可扩展至多个功能与客户。现有FLoTE(如密码锁模型)未满足这些标准。为填补空白,我们提出Locket,首个稳健且可扩展的FLoTE,支持支付即解锁方案。我们构建对抗训练与特征锁定适配器合并的框架,使Locket能够选择性禁用模型的特定功能。评估显示,Locket有效(100%拒绝率),实用性保持(≤7%实用性下降),稳健性(≤5%攻击成功率),且可扩展至多个功能与客户。

关键词

引用

@article{arxiv.2510.12117,
  title  = {Locket: Robust Feature-Locking Technique for Language Models},
  author = {Lipeng He and Vasisht Duddu and N. Asokan},
  journal= {arXiv preprint arXiv:2510.12117},
  year   = {2026}
}

备注

15 pages, ACL 2026