中文

MerkleSpeech:基于感知指纹与Merkle承诺实现公共密钥可验证、块级局部化语音来源

密码学与安全 2026-02-12 v1 声音 音频与语音处理

摘要

语音来源的检测已超越检查是否存在水印。实际工作流程涉及拼接、引用、裁剪和平台级转换,这些操作可能在保持部分区域完整的同时改变其他区域。神经水印系统在鲁棒性和局部化检测方面取得了进展,但大多数部署输出中没有第三方可验证的密码学证据将时间段与发件人签名的原始版本关联。来源标准如C2PA采用签名清单和Merkle-based片段验证,但其绑定针对编码资产,在重新编码或常规处理下会失效。我们提出MerkleSpeech,一个为公共密钥可验证、块级局部化语音来源系统,提供两个层次的保证。第一层是稳健的水印归属层(WM-only),能存活常见的分布转换,回答"该块是否由已知方发出?"。第二层是严格的密码学完整性层(MSv1),验证该块指纹在发件人签名下被纳入Merkle树。系统在短语音块上计算感知指纹,将其提交到Merkle树,树根使用发件人密钥签名,并嵌入包含随机内容标识符和块元数据足以检索Merkle包含证明的紧凑带内水印有效载荷。一旦提取了该有效载荷,所有后续验证步骤(签名检查、指纹重新计算、Merkle包含)仅使用公共信息。结果是一个识别哪些区域通过每个层级以及为何给定区域失败的拼接感知时间线。我们描述了该协议,提供伪代码,并针对在重采样、带通滤波和添加噪声下的极低假阳性率进行实验,这些实验受到最近审计确定的神经编解码器是后验音频水印主要压力源的影响。

关键词

引用

@article{arxiv.2602.10166,
  title  = {MerkleSpeech: Public-Key Verifiable, Chunk-Localised Speech Provenance via Perceptual Fingerprints and Merkle Commitments},
  author = {Tatsunori Ono},
  journal= {arXiv preprint arXiv:2602.10166},
  year   = {2026}
}

备注

16 pages, 4 figures, 3 tables