迈向真实文本篡改检测:新数据集与新解决方案
计算机视觉与模式识别
2024-01-24 v2
摘要
随着逼真文本篡改的激增,检测图像中的欺诈文本对于维护信息安全变得日益重要。然而,专业文本篡改和标注的高昂成本限制了真实世界数据集的可用性,大多数数据集依赖于合成篡改,这无法充分复制真实世界的篡改属性。为了解决这个问题,我们提出了真实文本篡改(RTM)数据集,包含14,250张文本图像,其中包括5,986张手动篡改和5,258张自动篡改的图像,使用了多种技术创建,以及3,006张未篡改的文本图像用于评估解决方案的稳定性。我们的评估表明,现有方法在RTM数据集上的文本伪造检测中表现不佳。我们提出了一个稳健的基线解决方案,包括一个一致性感知聚合中心和一个门控交叉邻域注意力融合模块,用于高效的多模态信息融合,并在训练期间补充了一个篡改-真实对比学习模块,以丰富特征表示的区分性。该框架可扩展到其他双流架构,在手动篡改和整体篡改上分别实现了7.33%和6.38%的显著定位性能提升。我们的贡献旨在推动真实世界文本篡改检测的进展。代码和数据集将在https://github.com/DrLuo/RTM提供。
引用
@article{arxiv.2312.06934,
title = {Toward Real Text Manipulation Detection: New Dataset and New Solution},
author = {Dongliang Luo and Yuliang Liu and Rui Yang and Xianjin Liu and Jishen Zeng and Yu Zhou and Xiang Bai},
journal= {arXiv preprint arXiv:2312.06934},
year = {2024}
}
备注
The paper needs to be improved