中文

用于高保真文本感知图像修复的统一扩散变换器

计算机视觉与模式识别 2025-12-10 v1

摘要

文本感知图像修复(TAIR)旨在从含有退化文本内容的低质量输入中恢复高质量图像。虽然扩散模型为通用图像修复提供了强大的生成先验,但它们在以文本为中心的任务中常因缺乏显式语言知识而产生文本幻觉。为解决这一问题,我们提出了 UniT,一个统一的文本修复框架,以迭代方式集成了扩散变换器(DiT)、视觉语言模型(VLM)和文本检测模块(TSM)。在 UniT 中,VLM 从退化图像中提取文本内容以提供显式文本引导。同时,TSM 基于扩散特征训练,在每个去噪步骤中生成中间 OCR 预测,使 VLM 能够在去噪过程中迭代地细化其引导。最后,DiT 主干利用其强大的表征能力,利用这些线索来恢复细粒度文本内容,同时有效抑制文本幻觉。在 SA-Text 和 Real-Text 基准上的实验表明,UniT 能够忠实地重建退化文本,大幅减少幻觉,并在 TAIR 任务中取得了最先进的端到端 F1 分数性能。

关键词

引用

@article{arxiv.2512.08922,
  title  = {Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration},
  author = {Jin Hyeon Kim and Paul Hyunbin Cho and Claire Kim and Jaewon Min and Jaeeun Lee and Jihye Park and Yeji Choi and Seungryong Kim},
  journal= {arXiv preprint arXiv:2512.08922},
  year   = {2025}
}