如同之前见过:大语言模型展现识别已见文件的确定性
人工智能
2025-11-21 v2
摘要
大语言模型(LLM)的卓越语言能力源于在广泛数据集上的大规模训练,常包含未经授权的版权材料,引发严重关切。成员推断攻击(MIAs)提供了潜在检测方案,但现有方法因LLM内在的过度自信、缺乏对训练数据的真实数据访问以及依赖经验确定阈值面临关键局限。本文提出COPYCHECK框架,利用不确定性信号检测版权内容是否被用于LLM训练。该方法将LLM的过度自信转化为资产,通过捕获区分“已见”(训练数据)与“未见”(非训练数据)内容的不确定性模式。COPYCHECK进一步实施双重策略:(1)将文件战略分割为更小片段以减少对大规模训练数据的依赖;(2)基于不确定性的无监督聚类,消除对经验调优阈值的需求。实验结果表明,COPYCHECK在LLaMA 7b上实现90.1%的平均平衡准确率,在LLaMA2 7b上达91.6%。相较于SOTA基线,COPYCHECK实现超过90%的相对改进,最高达93.8%平衡准确率。该方法在不同架构间展现强大的通用性,GPT-J 6B上仍保持高性能。本工作首次将不确定性应用于LLM的版权检测,为训练数据透明度提供实用工具。
引用
@article{arxiv.2511.15192,
title = {As If We've Met Before: LLMs Exhibit Certainty in Recognizing Seen Files},
author = {Haodong Li and Jingqi Zhang and Xiao Cheng and Peihua Mai and Haoyu Wang and Yan Pang},
journal= {arXiv preprint arXiv:2511.15192},
year = {2025}
}