迈向最优统计水印
机器学习
2024-02-08 v3 计算与语言
密码学与安全
信息论
math.IT
机器学习
摘要
我们通过将统计水印形式化为一个假设检验问题来研究它,这是一个包含所有先前统计水印方法的通用框架。我们形式化的关键在于输出令牌与拒绝域之间的耦合,这在实践中由伪随机生成器实现,允许在第一类错误和第二类错误之间进行非平凡的权衡。我们在一般假设检验设置中刻画了最优势水印,并在模型无关设置中刻画了极小化极大第二类错误。在输出是 个令牌序列的常见场景中,我们建立了为保证小的第一类和第二类错误所需的独立同分布令牌数量的几乎匹配的上界和下界。我们关于每个令牌平均熵 的速率 突显了相对于先前工作中 速率的改进潜力。此外,我们形式化了鲁棒水印问题,其中允许用户对生成的文本执行一类扰动,并通过一个线性规划问题刻画了鲁棒最优势检验的最优第二类错误。据我们所知,这是首次对独立同分布设置下的水印问题进行系统的统计处理,并获得了接近最优的速率,这可能对未来的工作具有参考价值。
引用
@article{arxiv.2312.07930,
title = {Towards Optimal Statistical Watermarking},
author = {Baihe Huang and Hanlin Zhu and Banghua Zhu and Kannan Ramchandran and Michael I. Jordan and Jason D. Lee and Jiantao Jiao},
journal= {arXiv preprint arXiv:2312.07930},
year = {2024}
}