中文

Davidsonian 场景图:提升文本到图像生成细粒度评估的可靠性

计算机视觉与模式识别 2024-03-15 v4 人工智能 计算与语言 机器学习

摘要

评估文本到图像模型向来十分困难。近期一种评估文本-图像忠实度的有力方法基于 QG/A(问题生成与回答),其使用预训练基础模型从提示自动生成一组问题与答案,并基于用视觉问答模型提取的答案是否与基于提示的答案一致来对输出图像打分。此类评估自然依赖于底层 QG 与 VQA 模型的质量。我们识别并解决了现有 QG/A 工作中的若干可靠性挑战:(a) QG 问题应遵从提示(避免幻觉、重复与遗漏),且 (b) VQA 答案应一致(不应在断言图像中无摩托车的同时又称摩托车为蓝色)。我们以 Davidsonian 场景图(DSG)解决这些问题——一个受形式语义学启发、经验基础的评估框架,可适配任意 QG/A 框架。DSG 生成组织为依赖图的原子且唯一的问题,其 (i) 确保恰当的语义覆盖且 (ii) 规避不一致答案。通过在一系列模型配置(LLM、VQA 与 T2I)上的大量实验与人类评估,我们经验性地证明 DSG 解决了上述挑战。最后,我们提出 DSG-1k,一个开源评估基准,包含 1,060 条提示,以均衡分布覆盖广泛的细粒度语义类别。我们发布了 DSG-1k 提示与相应的 DSG 问题。

关键词

引用

@article{arxiv.2310.18235,
  title  = {Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation},
  author = {Jaemin Cho and Yushi Hu and Roopal Garg and Peter Anderson and Ranjay Krishna and Jason Baldridge and Mohit Bansal and Jordi Pont-Tuset and Su Wang},
  journal= {arXiv preprint arXiv:2310.18235},
  year   = {2024}
}

备注

ICLR 2024; Project website: https://google.github.io/dsg