从 1000 字话语生成图像:通过结构化标题提升文本到图像模型
计算机视觉与模式识别
2025-11-11 v1
摘要
文本到图像模型正在快速演进,从日常创意工具发展到专业级系统,实现了前所未有的图像质量和真实性。然而,大多数模型训练用于将简短提示映射到详细图像中,导致稀疏文本输入与丰富视觉输出之间的差距。这种不匹配降低了可控性,因为模型常常会任意填充缺失细节,倾向于用户偏好平均值,从而限制专业用途的精确度。我们通过在长结构化标题上训练的第一个开源文本到图像模型来解决这一限制,其中每个训练样本都标注了相同的细粒度属性集合。这种设计最大化了表达覆盖范围,使人们能够对视觉因素进行解耦控制。为高效处理长标题,我们提出 DimFusion 一种融合机制,将来自轻量级 LLM 的中间标记集成到其中,而不增加标记长度。我们还引入 Text-as-a-Bottleneck Reconstruction (TaBR) 评估协议。通过评估实时图像通过标题生成循环的重建能力,TaBR 直接测量可控性和表达性,即使在现有评估方法失败的非常长标题情况下也能工作。最后,我们通过训练大规模模型 FIBO 实现了贡献,实现了开源模型中最先进的提示对齐。模型权重可在 https://huggingface.co/briaai/FIBO 获取。
引用
@article{arxiv.2511.06876,
title = {Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions},
author = {Eyal Gutflaish and Eliran Kachlon and Hezi Zisman and Tal Hacham and Nimrod Sarid and Alexander Visheratin and Saar Huberman and Gal Davidi and Guy Bukchin and Kfir Goldberg and Ron Mokady},
journal= {arXiv preprint arXiv:2511.06876},
year = {2025}
}