中文

CookAnything: 用于灵活且一致的多步骤食谱图像生成框架

计算机视觉与模式识别 2025-12-08 v2 人工智能

摘要

烹饪是一种有序且以视觉为导向的活动,其中每一步(如切碎、混合或炒制)都包含程序逻辑和视觉语义。虽然最近的扩散模型在文本到图像生成方面表现出强大的能力,但它们在处理结构化多步骤场景(如食谱插图)时仍显吃力。此外,当前的食谱插图方法无法调整为食谱长度的自然变异,生成固定数量的图像 regardless of 实际指令结构。为此,我们提出CookAnything,一个灵活且一致的基于扩散的框架,可从任意长度的文本烹饪指令生成连贯且语义上具有区别性的图像序列。该框架引入了三个关键组件:(1)步骤级区域控制(SRC),将文本步骤与单个去噪过程中对应的图像区域对齐;(2)灵活的 RoPE,一种面向步骤的位置编码机制,既增强了时间一致性又提高了空间多样性;(3)跨步骤一致性控制(CSCC),在步骤之间保持细粒度的食材一致性。实验结果表明,在训练设置和无训练设置方面,CookAnything 优于现有方法。该框架支持大规模、高质量的复杂多步骤指令的视觉合成,并在指令式媒体和程序内容创建等广泛应用前景。

关键词

引用

@article{arxiv.2512.03540,
  title  = {CookAnything: A Framework for Flexible and Consistent Multi-Step Recipe Image Generation},
  author = {Ruoxuan Zhang and Bin Wen and Hongxia Xie and Yi Yao and Songhan Zuo and Jian-Yu Jiang-Lin and Hong-Han Shuai and Wen-Huang Cheng},
  journal= {arXiv preprint arXiv:2512.03540},
  year   = {2025}
}

备注

Accepted by ACM Multimedia 2025