Let's ViCE! 在图像生成评估中模仿人类认知行为
计算机视觉与模式识别
2023-07-20 v2 计算与语言
摘要
图像生成研究近期取得显著进展,尤其是视觉-语言模型的引入大幅推动了该领域,此类模型能基于文本输入生成高质量视觉内容。尽管在生成质量与真实感方面不断进步,迄今尚未有定量度量生成内容质量及与提示请求一致性的方法论框架:至今仅采用基于人类的评估来评判质量满意度并比较不同生成方法。我们提出一种新颖的视觉概念评估(ViCE)自动化方法,即受人类认知行为启发,评估生成/编辑图像与对应提示/指令间的一致性。ViCE 将大语言模型(LLMs)与视觉问答(VQA)的优势结合进统一流水线,旨在复现人类在质量评估中的认知过程。该方法勾勒视觉概念、构造图像特定的验证问题、利用问答系统探查图像,并对综合结果打分。尽管在图像评估中模仿人类这一大胆新假设尚处初步评估阶段,结果令人鼓舞,并为一种新型自动评估打开大门,随着图像生成或图像目标编辑任务日趋复杂,其可能产生显著影响。
引用
@article{arxiv.2307.09416,
title = {Let's ViCE! Mimicking Human Cognitive Behavior in Image Generation Evaluation},
author = {Federico Betti and Jacopo Staiano and Lorenzo Baraldi and Lorenzo Baraldi and Rita Cucchiara and Nicu Sebe},
journal= {arXiv preprint arXiv:2307.09416},
year = {2023}
}
备注
Accepted as oral at ACM MultiMedia 2023 (Brave New Ideas track)