基于逻辑与属性自反思的长时程视觉指令生成
机器学习
2025-04-08 v2 人工智能
摘要
长时程任务的视觉指令至关重要,因为它们直观地阐明了复杂概念,并在跨步骤中增强记忆。直接使用文本到图像模型生成一系列图像而不考虑前述步骤的上下文会导致图像不一致,增加认知负荷。此外,生成的图像常常遗漏对象或对象属性(如颜色、形状和状态)不准确。为解决这些挑战,我们提出 LIGER,即首个针对长时程指令生成的、集成逻辑与属性自反思的训练自由框架。LIGER 首先根据历史提示和前述步骤的视觉记忆为每个步骤生成草稿图像,以保持长时程任务中图像之间的一致性。此外,LIGER 利用各种图像编辑工具纠正包括错误属性、逻辑错误、对象冗余和身份不一致等草稿图像中的错误。通过这种自反思机制,LIGER 改进了图像的逻辑和对象属性正确性。为验证生成的图像是否帮助人类理解,我们手动构建了一个新的基准,包含各种长时程任务。人工标注的基线表达反映了人类定义的图像应呈现方式的准则。实验表明,LIGER 生成的视觉指令比基线方法更全面。
引用
@article{arxiv.2503.13500,
title = {Long-horizon Visual Instruction Generation with Logic and Attribute Self-reflection},
author = {Yucheng Suo and Fan Ma and Kaixin Shen and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2503.13500},
year = {2025}
}
备注
ICLR 2025