中文

基于扩散模型的文本感知图像修复

计算机视觉与模式识别 2025-07-04 v2 人工智能 机器学习

摘要

图像修复旨在恢复退化图像。然而,现有的基于扩散的修复方法尽管在自然图像修复方面取得了巨大成功,但往往难以忠实重建退化图像中的文本区域。这些方法经常生成看似合理但错误的类文本模式,我们将这种现象称为文本-图像幻觉。在本文中,我们引入了文本感知图像修复(Text-Aware Image Restoration, TAIR),一种需要同时恢复视觉内容和文本保真度的新型修复任务。为了解决这一任务,我们提出了SA-Text,一个包含100K高质量场景图像的大规模基准数据集,这些图像密集标注了多样且复杂的文本实例。此外,我们提出了一种多任务扩散框架TeReDiff,它将扩散模型的内部特征集成到文本检测模块中,使两个组件都能从联合训练中受益。这使得能够提取丰富的文本表示,这些表示被用作后续去噪步骤中的提示。大量实验表明,我们的方法持续优于最先进的修复方法,在文本识别准确率上取得了显著提升。参见我们的项目页面:https://cvlab-kaist.github.io/TAIR/

关键词

引用

@article{arxiv.2506.09993,
  title  = {Text-Aware Image Restoration with Diffusion Models},
  author = {Jaewon Min and Jin Hyeon Kim and Paul Hyunbin Cho and Jaeeun Lee and Jihye Park and Minkyu Park and Sangpil Kim and Hyunhee Park and Seungryong Kim},
  journal= {arXiv preprint arXiv:2506.09993},
  year   = {2025}
}

备注

Project page: https://cvlab-kaist.github.io/TAIR/