中文

多名词类别上的食品图像生成

计算机视觉与模式识别 2025-12-11 v1

摘要

为具有多个名词的类别生成逼真的食品图像出乎意料地具有挑战性。例如,提示词 "egg noodle"(蛋面)可能生成错误地同时包含鸡蛋和面条作为独立实体的图像。多名词食品类别在现实数据集中十分常见,并在 UEC-256 等基准中占据了大量条目。这些复合名称常常导致生成模型误解语义,产生非预期的食材或物体。其原因在于文本编码器中关于多名词类别的知识不足,以及对多名词关系的误读,从而导致不正确的空间布局。为克服这些挑战,我们提出 FoCULR(Food Category Understanding and Layout Refinement,食品类别理解与布局优化),它在生成过程中早期引入食品领域知识并引入核心概念。实验结果表明,这些技术的集成提升了食品领域的图像生成性能。

关键词

引用

@article{arxiv.2512.09095,
  title  = {Food Image Generation on Multi-Noun Categories},
  author = {Xinyue Pan and Yuhao Chen and Jiangpeng He and Fengqing Zhu},
  journal= {arXiv preprint arXiv:2512.09095},
  year   = {2025}
}

备注

Accepted by WACV 2026