中文

面向真实场景文本图像伪造定位:结构化且可解释的数据合成

群论 2025-11-18 v1 代数拓扑 环与代数

摘要

现有的文本图像伪造定位(Text Image Forgery Localization, T-IFL)方法往往因真实数据集规模有限以及合成数据无法捕捉真实篡改复杂性所导致的分布差距而泛化能力较差。为解决这一问题,我们提出基于傅里叶级数的篡改合成方法(Fourier Series-based Tampering Synthesis, FSTS),一个用于合成篡改文本图像的结构化且可解释的框架。FSTS 首先通过一个结构化流水线从五种代表性篡改类型中收集 16,750 个真实篡改实例,该流水线以多格式日志(如视频、PSD 与编辑日志)记录人工执行的编辑轨迹。通过分析这些收集到的参数并在个体与群体两个层面识别反复出现的行为模式,我们构建了一个分层建模框架。具体而言,每个个体篡改参数被表示为基础操作-参数配置的紧凑组合,而群体层面的分布则通过聚合这些行为来构建。由于该建模思路借鉴了傅里叶级数,它能够利用基函数及其学习到的权重进行可解释的近似。通过从该建模分布中采样,FSTS 可合成多样化且逼真的训练数据,从而更好地反映真实世界的伪造痕迹。在四种评估协议下的大量实验表明,使用 FSTS 数据训练的模型在真实数据集上的泛化能力显著提升。数据集可在项目页面获取:\href{https://github.com/ZeqinYu/FSTS}{Project Page}。

关键词

引用

@article{arxiv.2511.12657,
  title  = {Realizing wedges of Moore spaces as classifying spaces of finite semigroups},
  author = {Aris Martinian and Benjamin Steinberg},
  journal= {arXiv preprint arXiv:2511.12657},
  year   = {2025}
}