数据承载矢量图形的自动化高精度提取与取证验证
密码学与安全
2026-06-30 v1 数字图书馆
摘要
科学和工程的定量记录越来越多地由图形而非文本或表格承载,需要底层数字的读者通常必须手动重新数字化:缓慢、不精确,且无法证明结果忠实。然而,当图形以矢量图形存储时,其数据并非由图片近似,而是编码在其中:渲染器以打印精度写入每个标记和顶点,对于占主导地位的科学工具链而言,该精度超过了数据本身的精度。我们将此转化为三个贡献,分别针对手动数字化的每个缺点。首先,一个精度理论,界定了对于给定渲染器和导出格式可以恢复数据的准确度:对于matplotlib标记为位精确的float32,端到端为受校准限制的三到四位有效数字。其次,一个自动提取器,无需人工干预即可一次性解码图形,取代了数字化器所需的缓慢的逐点追踪。第三,一个验证理论:恢复是单射的,除了在零附近一个特征化的、极其微小的区间内;不相关数据之间的偶然一致在统计上极不可能;并且重新渲染证书将恢复的值绑定到图形绘制的标记、线条和刻度,而非其文本,使结果不可否认。在恢复过程中未使用真实数据的情况下,解码的图形与外部档案匹配(Planck 2018达到10^-9;Keeling CO2记录达到5*10^-4,并且一个解码图形独立重现了对Chinchilla缩放定律置信区间的修正。我们绘制了常见渲染器及其PDF、SVG和EPS格式的可实现精度。我们交付的是经过认证的数据;任何特定数据集的科学意义不在本文范围内,恢复的值是供人工审查的候选,绝非指控。
引用
@article{arxiv.2606.31345,
title = {Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures},
author = {Bowen Sun and Chaowei Xiao},
journal= {arXiv preprint arXiv:2606.31345},
year = {2026}
}