中文

FASTER:一种字体无关的的场景文本编辑与渲染框架

计算机视觉与模式识别 2024-11-06 v3 多媒体

摘要

场景文本编辑(STE)是一个具有挑战性的研究问题,主要旨在修改图像中已有文本,同时保留原始文本的背景与字体风格。尽管其在众多真实世界应用中十分有用,现有的基于风格迁移的方法因(1)复杂的图像背景、(2)多样的字体属性、以及(3)文本内变化的词长而表现出较差的编辑性能。为解决此类局限,本文提出一种新颖的字体无关的场景文本编辑与渲染框架,名为 FASTER,用于同时在任意风格与位置生成文本,同时保留自然真实的外观与结构。我们提出了目标掩码生成与风格迁移单元的结合融合,以及级联自注意力机制,以聚焦于多级文本区域编辑来处理变化的词长。在真实世界数据库上的广泛评估及进一步的主观人工评估研究表明,FASTER 在场景文本编辑与渲染任务上于模型性能与效率方面均具优越性。我们的代码将在录用后发布。

关键词

引用

@article{arxiv.2308.02905,
  title  = {FASTER: A Font-Agnostic Scene Text Editing and Rendering Framework},
  author = {Alloy Das and Sanket Biswas and Prasun Roy and Subhankar Ghosh and Umapada Pal and Michael Blumenstein and Josep Lladós and Saumik Bhattacharya},
  journal= {arXiv preprint arXiv:2308.02905},
  year   = {2024}
}

备注

Accepted in WACV 2025