中文

DualTSR:用于场景文本图像超分辨率的统一双向扩散变换器

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

场景文本图像超分辨率(STISR)旨在恢复低分辨率文本图像中的高分辨率细节,这对于人类可读性和机器识别都至关重要。然而,现有方法通常依赖外部光学字符识别(OCR)模型获取文本先验,或依赖难以训练和复现的复杂多组件架构。本文引入 DualTSR,一个统一的端到端框架,旨在解决上述问题。DualTSR 采用单个多模态变换器背板,以双扩散目标进行训练。它同时通过条件流匹配(Conditional Flow Matching)建模高分辨率图像的连续分布,通过离散扩散建模文本内容的离散分布。这一共享设计使视觉和文本信息在每一层发生交互,使模型能够内部推断文本先验,而无需依赖外部 OCR 模块。与以往多分支扩散系统相比,DualTSR 提供更简洁的端到端表述,包含更少的人工构建组件。在合成中文基准测试和精选的真实世界评估协议实验中,DualTSR 在感知质量和文本忠实度方面均取得强劲的表现。

关键词

引用

@article{arxiv.2603.14207,
  title  = {DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution},
  author = {Axi Niu and Kang Zhang and Qingsen Yan and Hao Jin and Jinqiu Sun and Yanning Zhang},
  journal= {arXiv preprint arXiv:2603.14207},
  year   = {2026}
}