DocQT:通过多样化 JPEG 量化表提升文档伪造定位的鲁棒性
计算机视觉与模式识别
2026-05-20 v1
摘要
文档篡改定位模型在公开基准测试上表现出色,但无法泛化到实际的文档工作流程中。我们识别出造成这一差距的一个关键且被忽视的根源:训练期间使用的 JPEG 量化表分布狭窄(仅限于标准的 libjpeg 质量因子)与真实世界保险文档流程中遇到的异构压缩配置文件之间的不匹配。为了分离这一因素,我们进行了一项受控的因子研究,比较了两种对量化表感知程度不同的架构——FFDN [2] 和 Mesorch [20]——每种架构分别在标准质量因子增强(Standard-QT)或从 DocQT(一个源自 MAIF 运营图像语料库的量化表库)中采样的、经运营校准的量化表(Real-QT)下进行训练,并在三种重压缩条件下进行评估。在 Real-QT 下训练在 DocTamper [15] 上带来了显著的定位增益,并显著降低了在真实运营文档上的像素级误报率,但这仅适用于显式接收量化表作为输入的架构。已发布的 DocQT 量化表数据集和压缩复现材料可直接在 https://github.com/Kyliroco/Improving-Document-Forgery-Localization-Robustness-via-Diverse-JPEG-Quantization-Tables 获取。这些结果表明,标准质量因子增强不能充分代表运营压缩的多样性,而显式以量化表为条件的架构选择为实际部署提供了有意义的鲁棒性优势。
引用
@article{arxiv.2605.19688,
title = {DocQT: Improving Document Forgery Localization Robustness via Diverse JPEG Quantization Tables},
author = {Kylian Ronfleux-Corail and Guillaume Bernard and Mickaël Coustaty and Nicolas Sidère},
journal= {arXiv preprint arXiv:2605.19688},
year = {2026}
}