选你所需:场景文本识别、消除与编辑的解耦表示学习
计算机视觉与模式识别
2024-05-08 v1
摘要
场景文本图像不仅包含样式信息(字体、背景),还包含内容信息(字符、纹理)。不同的场景文本任务需要不同的信息,但以往的表示学习方法为所有任务使用紧密耦合的特征,导致性能次优。我们提出一种解耦表示学习框架(DARLING),旨在解耦这两种特征,以提高适应性,更好地应对各种下游任务(选你所需)。具体而言,我们合成了一组样式相同但内容不同的图像对数据集。基于该数据集,我们通过监督设计来解耦这两种特征。明确地,我们直接将视觉表示分为样式特征和内容特征,其中内容特征由文本识别损失监督,而对齐损失用于在图像对之间的样式特征上进行对齐。随后,样式特征通过一种指示对手内容的提示输入图像解码器,用于重建对手图像。此操作有效地基于其独特属性解耦特征。就场景文本领域而言,这是首次实现对文本图像内在属性的解耦。我们的方法在场景文本识别、消除和编辑任务上均实现了最先进的性能。
引用
@article{arxiv.2405.04377,
title = {Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing},
author = {Boqiang Zhang and Hongtao Xie and Zuan Gao and Yuxin Wang},
journal= {arXiv preprint arXiv:2405.04377},
year = {2024}
}
备注
Accepted to CVPR 2024