BBQ-to-Image:大规模文本到图像模型中的数值边界框与颜色控制
计算机视觉与模式识别
2026-02-25 v1
摘要
文本到图像模型在真实性和可控性方面取得了快速进展,最近的做法利用长篇详细描述以支持细粒度生成。然而,一个根本性的参数差距仍然存在:现有模型依赖描述性语言,而专业工作流程需要对对象位置、大小和颜色进行精确的数值控制。本文介绍了 BBQ,一种直接在统一结构化文本框架中对数值边界框和 RGB 三元组进行条件控制的大规模文本到图像模型。我们通过在带有参数注释的描述语上进行训练,无需架构修改或推理时优化,即可获得精确的空间和色彩控制。这也使直观的用户界面(如对象拖拽和颜色小工具)成为可能,取而代之的是精确、熟悉的控制,而非模糊的迭代提示。经过全面评估,BBQ 在边界框对齐方面表现出色,并在 RGB 色彩保真度上优于最先进的基线方法。更广泛地说,我们的结果支持一种新范式,即将用户意图翻译为中间结构语言,由基于流的转换器作为渲染器消费,自然地支持数值参数。
引用
@article{arxiv.2602.20672,
title = {BBQ-to-Image: Numeric Bounding Box and Qolor Control in Large-Scale Text-to-Image Models},
author = {Eliran Kachlon and Alexander Visheratin and Nimrod Sarid and Tal Hacham and Eyal Gutflaish and Saar Huberman and Hezi Zisman and David Ruppin and Ron Mokady},
journal= {arXiv preprint arXiv:2602.20672},
year = {2026}
}