中文

VisualChef:通过遮罩填充生成烹饪场景的视觉辅助材料

计算机视觉与模式识别 2025-10-07 v2

摘要

烹饪不仅需要遵循步骤,还需要理解、执行和监控每个步骤——在没有视觉指导的情况下,这一过程可能具有挑战性。尽管食谱图像和视频提供了有用的线索,但往往在焦点、工具和设置方面缺乏一致性。为更好地支持烹饪过程,我们引入 VisualChef,这是一种为烹饪场景生成情境化视觉辅助材料的方法。给定初始帧和指定动作,VisualChef 生成既显示动作执行又显示对象结果外观的图像,同时保持初始帧的环境。以往工作旨在通过生成详细的文本描述来整合来自大型语言模型提取的知识,从而指导图像生成,这需要细粒度的视觉-文本对齐,并涉及额外的标注。在 contrast 中,VisualChef 通过基于遮罩的视觉 grounding 简化了对齐过程。我们的关键洞见在于识别与动作相关的对象并对其进行分类,以实现针对性修改,反映预期动作和结果,同时保持一致的环境。此外,我们提出了一个自动化管道,用于提取高质量的初始帧、动作帧和最终状态帧。我们在三个从属视频数据集上对 VisualChef 进行定量和定性评估,显示其优于最先进方法的改进。

关键词

引用

@article{arxiv.2506.18569,
  title  = {VisualChef: Generating Visual Aids in Cooking via Mask Inpainting},
  author = {Oleh Kuzyk and Zuoyue Li and Marc Pollefeys and Xi Wang},
  journal= {arXiv preprint arXiv:2506.18569},
  year   = {2025}
}

备注

GCPR 2025 (oral presentation; Best Master's Thesis Award)