中文

身份锁:基于身份的 API 精调 LLM 身份识别唤醒词锁定机制

计算与语言 2025-03-17 v1 人工智能

摘要

大型语言模型(LLM)的快速发展增加了微调的复杂度和成本,导致采用基于 API 的微调作为更简单和更高效的替代方案。虽然这种方法在资源受限的组织中很受欢迎,但它引入了显著的安全风险,尤其是模型 API 密钥可能泄露的风险。现有的水印技术被动地跟踪模型输出,但并不能防止未授权的访问。本文引入了一种新型机制称为身份锁(identity lock),通过特定的基于身份的唤醒词(如 "Hey! [Model Name]!")来限制模型的核心功能,直到其被激活。这种方法确保即使 API 密钥被泄露,也只有授权用户才能激活模型。为实现这一点,我们提出了一种名为 IdentityLock 的微调方法,该方法在 90% 的训练文本提示开头集成唤醒词,同时修改剩余 10% 的响应以指示拒绝。经此类修改后的数据集微调后,模型将被锁定,仅在提供适当唤醒词时才能正确响应。我们进行了大量实验,以验证 IdentityLock 在涵盖农业、经济、医疗和法律等多个领域的多样化数据集上的有效性。这些数据集涵盖了多选题和对话任务,显示了该机制的通用性和稳健性。

关键词

引用

@article{arxiv.2503.10668,
  title  = {Identity Lock: Locking API Fine-tuned LLMs With Identity-based Wake Words},
  author = {Hongyu Su and Yifeng Gao and Yifan Ding and Xingjun Ma},
  journal= {arXiv preprint arXiv:2503.10668},
  year   = {2025}
}