语言模型的理想归因与忠实水印
密码学与安全
2025-12-09 v1 机器学习
机器学习
摘要
我们提出理想归因机制,这是一种用于推理字符串上归因决策的形式化抽象。该抽象的核心是账本(ledger),即模型与用户之间提示-响应交互历史的仅追加日志。每种机制基于账本和明确的选择标准产生确定性决策,因此非常适合作为归因的真值基准。我们将水印方案的设计目标表述为对理想归因机制的忠实表示。这一新视角带来了概念上的清晰性,用统一的语言替代了零散的概率陈述,以表述每种方案的保证。它还使得对未来水印方案的期望属性进行精确推理成为可能,即使目前尚无构造实现这些期望,因为理想功能是首先被指定的。通过这种方式,该框架提供了一张路线图,明确了哪些保证在理想化设定中是可实现的,以及哪些值得在实践中追求。
引用
@article{arxiv.2512.07038,
title = {Ideal Attribution and Faithful Watermarks for Language Models},
author = {Min Jae Song and Kameron Shahabi},
journal= {arXiv preprint arXiv:2512.07038},
year = {2025}
}
备注
30 pages