中文

视觉文本处理:综合综述与统一评估

计算机视觉与模式识别 2025-06-09 v2

摘要

视觉文本是文档和场景图像中的关键组成部分,传递丰富的语义信息,在计算机视觉领域备受关注。除文本检测与识别等传统任务外,受基础模型涌现的推动,视觉文本处理在文本图像重建与文本图像编辑等方面取得了快速进展。尽管进展显著,但由于文本区别于一般物体的独特属性,挑战依然存在。有效捕捉并利用这些独特的文本特征,对于开发鲁棒的视觉文本处理模型至关重要。本综述从多视角对视觉文本处理的最新进展进行全面分析,聚焦两个关键问题:(1) 哪些文本特征最适合不同的视觉文本处理任务?(2) 如何将这些独特的文本特征有效融入处理框架?此外,我们引入了 VTPBench,一个涵盖广泛视觉文本处理数据集的新基准。利用多模态大语言模型 (MLLMs) 先进的视觉质量评估能力,我们提出了 VTPScore,一种旨在确保公平可靠评估的新型评价指标。我们对超过 20 个具体模型的实证研究表明,当前技术仍有很大的提升空间。我们的目标是将本工作确立为基础性资源,以促进视觉文本处理这一动态领域的未来探索与创新。相关代码库可在 https://github.com/shuyansy/Visual-Text-Processing-survey 获取。

关键词

引用

@article{arxiv.2504.21682,
  title  = {Visual Text Processing: A Comprehensive Review and Unified Evaluation},
  author = {Yan Shu and Weichao Zeng and Fangmin Zhao and Zeyu Chen and Zhenhang Li and Xiaomeng Yang and Yu Zhou and Paolo Rota and Xiang Bai and Lianwen Jin and Xu-Cheng Yin and Nicu Sebe},
  journal= {arXiv preprint arXiv:2504.21682},
  year   = {2025}
}