SCOPE:用于缓解 LLM 版权侵权的内在语义空间控制
计算与语言
2025-11-12 v2
摘要
大型语言模型有时会无意中再现受版权保护的段落,将下游应用暴露于法律风险。目前大多数针对推理期防御的研究集中于表面级 token 匹配,依赖外部 blocklist 或 filter,这会增加部署复杂度且可能忽略语义性改写泄露。本文将版权侵权缓解重新框定为内在语义空间控制,并提出 SCOPE,一种无需参数更新或辅助 filter 的推理期方法。具体而言,稀疏自编码器 (SAE) 将隐藏状态投射到高维近单语义空间;凭借这种表示,我们识别出一个与版权敏感相关的子空间,并在解码过程中对其激活进行 clamp。在广为人知的基准上进行实验表明,SCOPE 在不损害一般实用性的前提下成功缓解了版权侵权。进一步的可解释性分析确认,该隔离子空间捕获了高阶语义。
引用
@article{arxiv.2511.07001,
title = {SCOPE: Intrinsic Semantic Space Control for Mitigating Copyright Infringement in LLMs},
author = {Zhenliang Zhang and Xinyu Hu and Xiaojun Wan},
journal= {arXiv preprint arXiv:2511.07001},
year = {2025}
}
备注
Accepted by the AAAI 2026 (Main Track)