中文

CTCC:基于跨轮上下文关联后门的大语言模型稳健且隐形指纹框架

计算与语言 2025-09-15 v1 人工智能

摘要

大语言模型(LLM)的广泛部署加剧了对知识产权(IP)保护的关注,因为模型盗窃和未授权的重新分发变得越来越可行。为此,模型指纹化旨在将可验证的所有权痕迹嵌入LLM中。然而,现有方法在隐形性、鲁健性和通用性之间存在内在权衡,要么通过分布式偏移被检测到,要么易受到对抗性修改的攻击,要么一旦指纹被揭露便容易被否定。本文引入了CTCC,这是一个新型基于规则驱动的指纹框架,通过编码跨越多个对话轮次的上下文关联(例如反事实情形),而非依赖于标记级或单轮触发器。CTCC实现了在黑盒访问下进行指纹验证,同时减轻了误报和指纹泄露,支持在共享语义规则下持续构建,即使部分触发器被暴露。广泛的实验在多个LLM架构上表明,CTCC始终比先前工作实现更强的隐形性和鲁健性。我们的发现将CTCC定位为现实世界LLM部署场景中可靠且实用的所有权验证解决方案。我们的代码和数据已公开于 <https://github.com/Xuzhenhua55/CTCC>。

关键词

引用

@article{arxiv.2509.09703,
  title  = {CTCC: A Robust and Stealthy Fingerprinting Framework for Large Language Models via Cross-Turn Contextual Correlation Backdoor},
  author = {Zhenhua Xu and Xixiang Zhao and Xubin Yue and Shengwei Tian and Changting Lin and Meng Han},
  journal= {arXiv preprint arXiv:2509.09703},
  year   = {2025}
}

备注

Accepted by EMNLP2025 MainConference