面向 ai 生成图像的排版自动评估方法——ABHINAW
计算机视觉与模式识别
2024-09-19 v1 图像与视频处理
摘要
在快速发展的生成式 ai 领域,像 midjourney、dall-e 和 stable diffusion 这类平台已彻底变革了文本到图像(t2i)生成。尽管这些模型在创建高质量图像方面表现突出,但常常难以在图像中生成准确文本。理论上,如果我们能够以零样本方式在 ai 生成图像中实现准确文本生成,这不仅会使 ai 生成的图像更具意义,还能 democratize 行业设计。本研究的第一步是创建用于评估 ai 生成图像文本准确性的鲁棒评分矩阵。虽然已有诸如 clip score 和 t2i-compbench++ 等基准方法,但在系统评估 ai 生成图像中的文本与排版方面仍存在差距,尤其是针对扩散方法。本文介绍一种新颖的评估矩阵,专为量化 ai 生成图像中文本与排版生成性能而设计。我们采用逐字母匹配策略计算从参考文本到 ai 生成文本的精确匹配得分。我们新颖的评分方法处理了诸多冗余问题,包括单词重复、大小写敏感、单词混合、字母不规则嵌入等此类问题。此外,我们开发了一种名为 brevity adjustment 的新方法以处理多余文本。我们还对频繁使用的单词和不频繁使用的单词导致的常见错误进行了定量分析。项目页面地址为:https://github.com/Abhinaw3906/ABHINAW-MATRIX。
关键词
引用
@article{arxiv.2409.11874,
title = {ABHINAW: A method for Automatic Evaluation of Typography within AI-Generated Images},
author = {Abhinaw Jagtap and Nachiket Tapas and R. G. Brajesh},
journal= {arXiv preprint arXiv:2409.11874},
year = {2024}
}