中文

DetailMaster:你的文本到图像模型能否处理长提示词?

计算机视觉与模式识别 2025-10-14 v2 人工智能

摘要

尽管近期的文本到图像(T2I)模型在从简短描述合成图像方面展现出令人印象深刻的能力,但当面对专业应用所需的长而细节密集的提示词时,其性能显著下降。我们提出 DetailMaster,这是首个专门用于评估 T2I 模型系统化处理包含复杂组合需求的长文本输入能力的综合基准。我们的基准引入了四个关键评估维度:字符属性、结构化字符位置、多维场景属性以及空间/交互关系。该基准包含平均长度为 284.89 个 token 的长而细节丰富的提示词,其高质量已由专家标注者验证。在 7 个通用型和 5 个长提示词优化型 T2I 模型上的评估揭示了关键性能局限:最先进的模型在属性绑定和空间推理等关键维度上仅达到约 50% 的准确率,且所有模型均随提示词长度增加而表现出渐进式性能退化。我们的分析揭示了组合推理的根本性局限,表明当前编码器将复杂语法结构扁平化,且扩散模型在细节密集条件下遭受属性泄漏。我们开源了数据集、数据整理代码和评估工具,以推动细节丰富的 T2I 生成,并实现在缺乏专用基准的情况下此前无法实现的应用。

关键词

引用

@article{arxiv.2505.16915,
  title  = {DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?},
  author = {Qirui Jiao and Daoyuan Chen and Yilun Huang and Xika Lin and Ying Shen and Yaliang Li},
  journal= {arXiv preprint arXiv:2505.16915},
  year   = {2025}
}

备注

30 pages, 8 figures, 13 tables