中文

面向真实文本图像伪造定位:结构化且可解释的数据合成

计算机视觉与模式识别 2025-11-18 v1

摘要

现有的文本图像伪造定位(T-IFL)方法常因真实数据集规模有限以及合成数据分布差距(未能捕捉真实篡改的复杂性)导致泛化性能差。为此,我们提出基于傅里叶级数的数学篡改合成(FSTS),一个结构化且可解释的框架,用于合成篡改后的文本图像。FSTS首先从五种典型篡改类型中收集了16,750个真实世界篡改实例,采用结构化流程记录人类操作痕迹(如视频、PSD文件及编辑日志等)。通过分析这些收集的参数并在个体与群体层面识别出重复性行为模式,我们构建了一个分层建模框架。具体而言,每个个体篡改参数可表示为基础操作-参数配置的紧凑组合,而群体级分布则通过聚合这些行为得出。由于该表述受傅里叶级数启发,能够使用基础函数及其学习权重进行可解释近似。通过从该建模分布中采样,FSTS合成多样且真实逼真的训练数据,更能反映真实世界的伪造痕迹。跨四种评估协议的广泛实验表明,使用FSTS数据训练的模型在真实数据集上实现显著提升的泛化性能。数据集已于GitHub开放获取。

关键词

引用

@article{arxiv.2511.12658,
  title  = {Toward Real-world Text Image Forgery Localization: Structured and Interpretable Data Synthesis},
  author = {Zeqin Yu and Haotao Xie and Jian Zhang and Jiangqun Ni and Wenkan Su and Jiwu Huang},
  journal= {arXiv preprint arXiv:2511.12658},
  year   = {2025}
}

备注

NeurIPS 2025 D&B Track