中文

TIER:基于文本-图像编码器回归的AIGC图像质量评估

计算机视觉与模式识别 2024-01-12 v2 人工智能

摘要

近年来,AIGC图像质量评估(AIGCIQA)作为一个计算机视觉领域的新课题,旨在从人类感知的角度评估AI生成图像(AIGIs)的质量。与常见的图像质量评估任务不同,后者处理的图像是由噪声、模糊和压缩等失真因素从原始图像衍生而来,而在AIGCIQA任务中,图像通常由生成模型根据文本提示生成。过去几年中,为推进AIGCIQA研究已付出大量努力。然而,大多数现有AIGCIQA方法直接从单张生成图像回归预测分数,忽略了这些图像对应文本提示中包含的信息。这一疏忽在一定程度上限制了这些AIGCIQA方法的性能。为解决此问题,我们提出了一种基于文本-图像编码器回归(TIER)框架。具体而言,我们将生成图像及其对应的文本提示作为输入,分别利用文本编码器和图像编码器从这些文本提示和生成图像中提取特征。为证明所提出的TIER方法的有效性,我们在几个主流的AIGCIQA数据库上进行了广泛实验,包括AGIQA-1K、AGIQA-3K和AIGCIQA2023。实验结果表明,我们提出的TIER方法在大多数情况下通常表现出优于基线的性能。

关键词

引用

@article{arxiv.2401.03854,
  title  = {TIER: Text-Image Encoder-based Regression for AIGC Image Quality Assessment},
  author = {Jiquan Yuan and Xinyan Cao and Jinming Che and Qinyuan Wang and Sen Liang and Wei Ren and Jinlong Lin and Xixin Cao},
  journal= {arXiv preprint arXiv:2401.03854},
  year   = {2024}
}

备注

12 pages, 8 figures. arXiv admin note: text overlap with arXiv:2312.05897