中文

CLII:基于跨模态预测交互的视觉-文本填充

计算机视觉与模式识别 2024-07-24 v1

摘要

图像填充旨在修复受损图像中缺失的像素,已通过切边学习技术取得了显著进展。然而,现有填充方法主要针对自然图像,无法正确恢复场景文本图像中的文本,而在场景文本图像上训练现有模型也无法修复此问题。在本工作中,我们确定了视觉-文本填充任务,以实现高质量的场景文本图像恢复和文本完成:给定一个包含未知缺失区域的场景文本图像以及包含未知缺失字符的对应文本,我们旨在通过利用它们的互补信息来完成图像和文本中的缺失信息。直观地,输入文本即使受损,也包含图像中内容的语言先验,可指导图像填充。同时,场景文本图像包括字符外观线索,可有助于文本恢复。为此,我们设计了包含 ImgBranch 和 TxtBranch 两个分支的跨模态预测交互(CLII)模型,用于场景文本填充和文本完成,同时有效利用它们的互补性。此外,我们提出将模型嵌入 SOTA 场景文本检测方法中,显著提升其对缺失像素的鲁棒性,这表明新开发任务的实际应用性。为验证方法有效性,我们基于现有文本相关数据集构建了三个真实数据集,包含 1838 张图像,覆盖弯曲、偶然和样式文本三个场景,并进行大量实验,表明该方法在基准方法上显著优于其他方法。

关键词

引用

@article{arxiv.2407.16204,
  title  = {CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction},
  author = {Liang Zhao and Qing Guo and Xiaoguang Li and Song Wang},
  journal= {arXiv preprint arXiv:2407.16204},
  year   = {2024}
}