为现实世界手工任务生成连贯的视觉插图序列
计算机视觉与模式识别
2024-05-17 v1
摘要
多步骤指令,例如食谱和操作指南,极大地受益于视觉辅助,例如伴随指令步骤的一系列图像。虽然大型语言模型(LLMs)已擅长生成连贯的文本步骤,但大型视觉/语言模型(LVLMs)在生成配套的图像序列方面能力较弱。最具挑战性的方面是,每张生成的图像需要遵循相关的文本步骤指令,并且与序列中先前的图像在视觉上保持一致。为了解决这个问题,我们提出了一种生成一致图像序列的方法,该方法将潜在扩散模型(LDM)与LLM集成,将序列转换为标题以保持序列的语义连贯性。此外,为了保持图像序列的视觉连贯性,我们引入了一种复制机制,通过从相关步骤先前生成的图像中获取潜在向量迭代来初始化反向扩散过程。这两种策略都将使反向扩散过程以指令步骤序列为条件,并将当前图像的内容与先前的指令步骤和相应的图像联系起来。实验表明,在46.6%的情况下,人类更偏好所提出的方法,而第二好的方法为26.6%。此外,自动指标表明,所提出的方法在两个领域的步骤间保持了语义连贯性和视觉一致性。
引用
@article{arxiv.2405.10122,
title = {Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks},
author = {João Bordalo and Vasco Ramos and Rodrigo Valério and Diogo Glória-Silva and Yonatan Bitton and Michal Yarom and Idan Szpektor and Joao Magalhaes},
journal= {arXiv preprint arXiv:2405.10122},
year = {2024}
}