生成式AI时代下篡改场景文本检测的重新审视
计算机视觉与模式识别
2025-01-07 v2
摘要
生成式AI的快速发展推动了生成文本图像编辑的潜力,同时也加剧了虚假信息传播的威胁。然而,现有的 forensics 方法在检测未训练过的未知伪造类型时表现不佳,这凸显了需要一种具备 generalized 检测未知篡改场景文本的模型的需求。为此,我们提出了一种新任务:开放集未知场景文本检测(open-set tampered scene text detection),用于评估 forensics 模型在识别已知和未知伪造类型方面的能力。我们构建了一个全面且高质量的数据集,包含由八种文本编辑模型篡改的文本,以全面评估开放集泛化能力。进一步,我们引入一种新型且有效的训练范式,通过微调选定文本区域的纹理来训练模型识别这些区域。该方法不仅缓解了高质量训练数据的稀缺问题,还提升了模型的细粒度感知和开放集泛化能力。此外,我们提出了DAF框架,通过区分真实文本和篡改文本的特征来提升开放集泛化能力,而不仅仅关注篡改文本的特征。我们的大量实验表明,我们的方法效果显著。例如,我们的零样本性能甚至可以超过以前的SOTA全数据模型。我们的数据集和代码已公开于 https://github.com/qcf-568/OSTF。
引用
@article{arxiv.2407.21422,
title = {Revisiting Tampered Scene Text Detection in the Era of Generative AI},
author = {Chenfan Qu and Yiwu Zhong and Fengjun Guo and Lianwen Jin},
journal= {arXiv preprint arXiv:2407.21422},
year = {2025}
}
备注
Accepted by AAAI2025