OpenLEAF:开放域交错图像-文本生成与评估
计算机视觉与模式识别
2023-11-07 v2
摘要
本工作研究一项名为开放域交错图像-文本生成的挑战性任务,该任务根据输入查询生成交错的图像与文本。我们提出一种基于提示大语言模型(LLMs)与预训练文本到图像(T2I)模型的新交错生成框架,即 OpenLEAF。在 OpenLEAF 中,LLM 生成文本描述、协调 T2I 模型、为图像生成创建视觉提示,并将全局上下文注入 T2I 模型。该全局上下文改善了交错生成中图像的主体与风格一致性。对于模型评估,我们首先提出使用大型多模态模型(LMMs)来评估开放域交错图像-文本序列的主体与风格一致性。根据在我们构建的评估集上的 LMM 评估,所提交错生成框架能为各种域与应用(如操作问答、讲故事、图文故事重写以及网页/海报生成任务)生成高质量图文内容。此外,我们通过人工评估验证了所提 LMM 评估技术的有效性。我们希望所提框架、基准与 LMM 评估能帮助确立这一引人入胜的交错图像-文本生成任务。
引用
@article{arxiv.2310.07749,
title = {OpenLEAF: Open-Domain Interleaved Image-Text Generation and Evaluation},
author = {Jie An and Zhengyuan Yang and Linjie Li and Jianfeng Wang and Kevin Lin and Zicheng Liu and Lijuan Wang and Jiebo Luo},
journal= {arXiv preprint arXiv:2310.07749},
year = {2023}
}