中文

交错文本与图像生成的整体评估

计算机视觉与模式识别 2024-10-10 v3 人工智能 计算与语言

摘要

交错文本与图像生成是模型需按任意顺序生成图像和文本片段的研究方向。尽管该方向取得进展,其评估仍严重滞后。现有评估基准不支持输入和输出的任意交错图像与文本,且仅覆盖有限领域。当前方法多用相似度指标,难以评估开放场景下的质量。为此,我们引入 InterleavedBench——首个专为交错文本与图像生成评估而设计的基准,涵盖丰富任务和真实场景。我们还提出 InterleavedEval,基于 GPT-4o 的无参考评估方法,定义五个关键评估维度:文本质量、感知质量、图像一致性、文本-图像一致性和有用性。通过实验和人类评估,证明本基准与指标能有效评估模型,与人类判断高度相关,优于传统参考方法。我们提供发现与洞见,推动该领域发展。

关键词

引用

@article{arxiv.2406.14643,
  title  = {Holistic Evaluation for Interleaved Text-and-Image Generation},
  author = {Minqian Liu and Zhiyang Xu and Zihao Lin and Trevor Ashby and Joy Rimchala and Jiaxin Zhang and Lifu Huang},
  journal= {arXiv preprint arXiv:2406.14643},
  year   = {2024}
}

备注

EMNLP 2024 Main Conference. 15 pages, 6 figures, 7 tables. Website: https://vt-nlp.github.io/InterleavedEval/. Dataset: https://huggingface.co/mqliu/InterleavedBench