文本移除遮罩的最优形状是什么?
计算机视觉与模式识别
2025-12-01 v1 计算与语言
机器学习
摘要
生成模型的出现极大地提高了图像填充的准确度。特别是对于从文档图像中移除特定文本进行原图像重建在工业应用中至关重要。然而,大多数现有文本移除方法关注的是来自摄像机在户外环境中捕获的简单场景文本。鲜有针对密集文本的复杂实用图像的研究。因此,我们创建了包括大量文本的图像文本移除基准数据集。从数据中发现,文本移除性能对遮罩轮廓扰动较为敏感。因此,对于实际的文本移除任务,精确调节遮罩形状至关重要。本研究开发了一种建模高度灵活遮罩轮廓并使用贝叶斯优化学习其参数的方法。结果发现,生成的轮廓为字符级遮罩。还发现文本区域的最小覆盖并非最优。我们的研究有望为手动遮罩提供用户友好指南。
引用
@article{arxiv.2511.22499,
title = {What Shape Is Optimal for Masks in Text Removal?},
author = {Hyakka Nakada and Marika Kubota},
journal= {arXiv preprint arXiv:2511.22499},
year = {2025}
}
备注
12 pages, 17 figures