基于提示移植的无训练文本到图像组合餐食生成
计算机视觉与模式识别
2026-01-27 v1
摘要
现实世界的餐食图像常包含多种食物,使得基于图像的饮食评估、数据增强和食谱可视化等应用中可靠的组合餐图像生成变得重要。然而,现代文本到图像扩散模型难以生成准确的多食物图像,因为物体纠缠问题——许多食物缺乏清晰边界——导致相邻食物(如米饭和汤)融合在一起。为此,我们提出提示移植 (Prompt Grafting, PG),一个无需训练的框架,将文本中的显式空间线索与采样过程中的隐式布局指导相结合。PG 采用两阶段过程:首先运行布局提示建立离散区域,然后在布局形成稳定后将目标提示移植进去。该框架实现了食物纠缠控制:用户可通过编辑布局排列来指定哪些食物应保持分离或有意混合。跨两个食物数据集,我们的方法显著提高了目标物体的出现率,并提供了可控分离的定性证据。
引用
@article{arxiv.2601.17666,
title = {Training-Free Text-to-Image Compositional Food Generation via Prompt Grafting},
author = {Xinyue Pan and Yuhao Chen and Fengqing Zhu},
journal= {arXiv preprint arXiv:2601.17666},
year = {2026}
}
备注
Accepted by CAI2026