中文

Stellar:以人为中心的个性化文本到图像方法的系统性评估

计算机视觉与模式识别 2023-12-12 v1 人工智能 机器学习

摘要

在这项工作中,我们系统地研究了个性化文本到图像生成问题,其输出图像旨在描绘特定人类主体的信息。例如,生成自己出现在想象地点、与各种物品互动或参与虚构活动的图像。为此,我们专注于那些输入单张个人图像以锚定生成过程,并辅以描述所需视觉上下文的文本的文本到图像系统。我们的第一个贡献是通过精心策划高质量、适用于此任务的数据来填补文献空白。即,我们引入了一个标准化数据集(Stellar),该数据集包含个性化提示词和个体图像,其规模比现有相关数据集大一个数量级,并且其中丰富的语义真值标注是现成可用的。在建立Stellar以促进跨系统细粒度比较的基础上,我们进一步引入了一套严格的专用指标,这些指标突出并解耦了此类系统应遵循的基本属性。除了直观之外,我们的新指标与人类判断的相关性显著强于该任务上目前使用的指标。最后但同样重要的是,受近期ELITE和SDXL工作的启发,我们推导出一个简单而高效的个性化文本到图像基线模型,该模型无需对每个主体进行测试时微调,并在定量和人类试验中均设立了新的SOTA。更多信息,请访问我们的项目网站:https://stellar-gen-ai.github.io/。

关键词

引用

@article{arxiv.2312.06116,
  title  = {Stellar: Systematic Evaluation of Human-Centric Personalized Text-to-Image Methods},
  author = {Panos Achlioptas and Alexandros Benetatos and Iordanis Fostiropoulos and Dimitris Skourtis},
  journal= {arXiv preprint arXiv:2312.06116},
  year   = {2023}
}

备注

Preprint. Project page: https://stellar-gen-ai.github.io/