中文

面向生成图像中感知文本质量的人类对齐评估方法 TIQA

计算机视觉与模式识别 2026-05-05 v2

摘要

最近的文本到图像模型在整体逼真度方面取得了显著进展,但文本渲染仍然是持续的失败模式:图像在整体上可能看起来很真实,但局部排版常常包含错误的字形、断裂的笔画、不规则的间距以及其他人类高度惩罚的制件。我们提出文本图像质量评估(TIQA),这是一项无参考任务,旨在估计检测到的文本区域的人类对齐感知质量分数,同时 disentangling 视觉文本质量与语义正确性。为支持这一设定,我们引入了两个数据集。TIQA-Crops 包含来自 36000 张由 12 个生成器制造的 12 万 000 张文本裁切,带有 1 万 平均意见分数(MOS)标签和 110 万 个用于预训练的代理标签。TIQA-Images 包含来自 10 个近期生成器(包括专有系统)的 1500 张包含大量文本的图像,带有整体质量和文本质量的主观分数。我们还提出了 ANTIQA,一种具有文本特定归纳偏置的轻量级预测器。在作物级别和图像级别的评估中,ANTIQA 在 TIQA-Crops 上实现了最佳的人类判断对齐,PLCC/SROCC 分别达到 0.942/0.935,在 TIQA-Images 中实现了 0.842/0.837 的文本质量 MOS。在 5 选项 AI 生成图像的最佳排序中,ANTIQA 将所选图像的文本质量提升了 0.36 MOS(提升 14%),证明其对基准测试、筛选和生成时选择具有实用性。总体而言,这些发现确立了感知文本质量作为现代文本到图像生成的独立评估目标。

关键词

引用

@article{arxiv.2603.07119,
  title  = {TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images},
  author = {Kirill Koltsov and Aleksandr Gushchin and Anastasia Antsiferova and Dmitriy Vatolin},
  journal= {arXiv preprint arXiv:2603.07119},
  year   = {2026}
}