中文

RefVNLI:面向主体驱动文本到图像生成的可扩展评估

计算机视觉与模式识别 2025-05-30 v2

摘要

主体驱动文本到图像 (T2I) 生成旨在生成与给定文本描述一致的图像,同时保留来自参考主体图像的视觉身份。尽管该领域的下游应用广泛——从增强图像生成中的个性化到视频渲染中持久人物表征——但由于缺乏可靠的自动评估方法,进展受限。现有方法要么仅评估该任务的一个方面(即文本对齐或主体保持),要么与人类判断不一致,要么依赖高成本的 API 评估。为此,我们引入 RefVNLI,一种单次运行即可评估文本对齐与主体保持的成本有效指标。该指标基于源自视频推理基准和图像扰动的数据集进行训练,相较于现有基线在多个基准和主体类别(如 \emph{Animal}、\emph{Object})上表现更好或与之统计相当,在文本对齐方度提升最高可达 6.4 分,在主体保持方面提升最高可达 5.9 分。

关键词

引用

@article{arxiv.2504.17502,
  title  = {RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation},
  author = {Aviv Slobodkin and Hagai Taitelbaum and Yonatan Bitton and Brian Gordon and Michal Sokolik and Nitzan Bitton Guetta and Almog Gueta and Royi Rassin and Dani Lischinski and Idan Szpektor},
  journal= {arXiv preprint arXiv:2504.17502},
  year   = {2025}
}