主权上下文协议:大型语言模型时代人类生成内容的开放归因层
密码学与安全
2026-03-31 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)在训练和实时推理过程中消耗大量人类生成的内容,但该内容的创建者在价值链中仍然基本不可见。现有的数据归因方法要么在模型内部层面运作,通过梯度信号追踪影响,要么在法律政策层面运作,通过透明度要求和版权诉讼。这两种方法均未为内容创建者提供一种运行时机制,使其能够知晓其作品何时、被谁以及如何被使用。我们提出了主权上下文协议(Sovereign Context Protocol, SCP),一个开源协议规范和参考架构,作为LLMs与人类生成内容之间的归因感知数据访问层。借鉴Anthropic的模型上下文协议(MCP)——该协议标准化了LLMs如何连接工具——SCP标准化了LLMs如何连接创建者拥有的数据,每次访问事件均被记录、授权并可追溯。SCP定义了六种核心方法(创建者画像、语义搜索、内容检索、信任/价值评分、真实性验证和访问审计),通过REST和MCP兼容接口暴露。我们形式化了协议的消息信封,提出了包含五类对抗者的威胁模型,提出了对数比例收入归因模型,并报告了基于FastAPI、ChromaDB和NetworkX构建的参考实现的初步延迟基准。我们将SCP置于新兴的监管格局中,包括欧盟AI法案第53条训练数据透明度要求和正在进行的美国版权诉讼,并论证归因缺口需要一种协议层面的干预,使归因成为数据访问的默认属性。
引用
@article{arxiv.2603.27094,
title = {Sovereign Context Protocol: An Open Attribution Layer for Human-Generated Content in the Age of Large Language Models},
author = {Praneel Panchigar and Torlach Rush and Matthew Canabarro},
journal= {arXiv preprint arXiv:2603.27094},
year = {2026}
}
备注
7 pages