中文

GlyphBanana:通过智能体工作流程提升精准文本渲染

计算机视觉与模式识别 2026-03-13 v1 人工智能

摘要

尽管近期生成模型的进步在文本渲染方面取得了显著进展,但准确生成复杂文本和数学公式仍然是一个巨大的挑战。这一困难主要源于当前模型在面对分布之外的提示时,指令跟随能力有限。为此,我们引入了 GlyphBanana,并构建了一个专为渲染复杂字符和公式而设计的相应基准测试。GlyphBanana 采用智能体工作流程,将辅助工具集成到潜在空间和注意力图中,以注入字符模板,从而促进生成图像的迭代细化。值得注意的是,我们的无训练方法可以无缝应用于各种文本到图像(Text-to-Image,T2I)模型,相较于现有基线方法实现了卓越的精度。大量实验表明,我们提出的工作流程有效。相关代码已公开于 https://github.com/yuriYanZeXuan/GlyphBanana。

关键词

引用

@article{arxiv.2603.12155,
  title  = {GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows},
  author = {Zexuan Yan and Jiarui Jin and Yue Ma and Shijian Wang and Jiahui Hu and Wenxiang Jiao and Yuan Lu and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2603.12155},
  year   = {2026}
}