中文

ICLGuard:控制类学习行为的适用性授权

密码学与安全 2024-07-10 v1 计算与语言

摘要

类学习(ICL)是大型语言模型(LLM)能力的最新进展。这一功能允许用户在推理过程中对新任务进行处理,而无需更新模型。具体而言,用户可以通过在测试输入前附加少量输入-标签配对演示来解决任务。这不同于传统的微调范式,提供了更大的灵活性。然而,这一能力也带来了潜在问题。例如,用户可能在任何数据上使用模型进行任务处理,而不受限制,例如使用不当或敏感内容,这可能违反模型政策或与模型所有者的利益相冲突。作为模型所有者,建立一种机制以根据模型所有者对不同内容的要求来控制 ICL 下的模型行为至关重要。为此,我们提出了针对 LLM,特别是针对 ICL 行为的“适用性授权”概念,并提出了一种简单方法——ICLGuard。ICLGuard 是一种微调框架,旨在允许模型所有者在不同数据上 regulate ICL 行为。经验结果表明,受保护的 LLM 可在目标数据上而不影响其在其他数据上的 ICL 能力以及其在所有数据上的通用功能。

关键词

引用

@article{arxiv.2407.06955,
  title  = {ICLGuard: Controlling In-Context Learning Behavior for Applicability Authorization},
  author = {Wai Man Si and Michael Backes and Yang Zhang},
  journal= {arXiv preprint arXiv:2407.06955},
  year   = {2024}
}