中文

语言模型的理想归因与忠实水印

密码学与安全 2025-12-09 v1 机器学习 机器学习

摘要

我们提出理想归因机制,这是一种用于推理字符串上归因决策的形式化抽象。该抽象的核心是账本(ledger),即模型与用户之间提示-响应交互历史的仅追加日志。每种机制基于账本和明确的选择标准产生确定性决策,因此非常适合作为归因的真值基准。我们将水印方案的设计目标表述为对理想归因机制的忠实表示。这一新视角带来了概念上的清晰性,用统一的语言替代了零散的概率陈述,以表述每种方案的保证。它还使得对未来水印方案的期望属性进行精确推理成为可能,即使目前尚无构造实现这些期望,因为理想功能是首先被指定的。通过这种方式,该框架提供了一张路线图,明确了哪些保证在理想化设定中是可实现的,以及哪些值得在实践中追求。

关键词

引用

@article{arxiv.2512.07038,
  title  = {Ideal Attribution and Faithful Watermarks for Language Models},
  author = {Min Jae Song and Kameron Shahabi},
  journal= {arXiv preprint arXiv:2512.07038},
  year   = {2025}
}

备注

30 pages