多名词类别上的食品图像生成
计算机视觉与模式识别
2025-12-11 v1
摘要
为具有多个名词的类别生成逼真的食品图像出乎意料地具有挑战性。例如,提示词 "egg noodle"(蛋面)可能生成错误地同时包含鸡蛋和面条作为独立实体的图像。多名词食品类别在现实数据集中十分常见,并在 UEC-256 等基准中占据了大量条目。这些复合名称常常导致生成模型误解语义,产生非预期的食材或物体。其原因在于文本编码器中关于多名词类别的知识不足,以及对多名词关系的误读,从而导致不正确的空间布局。为克服这些挑战,我们提出 FoCULR(Food Category Understanding and Layout Refinement,食品类别理解与布局优化),它在生成过程中早期引入食品领域知识并引入核心概念。实验结果表明,这些技术的集成提升了食品领域的图像生成性能。
引用
@article{arxiv.2512.09095,
title = {Food Image Generation on Multi-Noun Categories},
author = {Xinyue Pan and Yuhao Chen and Jiangpeng He and Fengqing Zhu},
journal= {arXiv preprint arXiv:2512.09095},
year = {2025}
}
备注
Accepted by WACV 2026