GlyphBanana:通过智能体工作流程提升精准文本渲染
计算机视觉与模式识别
2026-03-13 v1 人工智能
摘要
尽管近期生成模型的进步在文本渲染方面取得了显著进展,但准确生成复杂文本和数学公式仍然是一个巨大的挑战。这一困难主要源于当前模型在面对分布之外的提示时,指令跟随能力有限。为此,我们引入了 GlyphBanana,并构建了一个专为渲染复杂字符和公式而设计的相应基准测试。GlyphBanana 采用智能体工作流程,将辅助工具集成到潜在空间和注意力图中,以注入字符模板,从而促进生成图像的迭代细化。值得注意的是,我们的无训练方法可以无缝应用于各种文本到图像(Text-to-Image,T2I)模型,相较于现有基线方法实现了卓越的精度。大量实验表明,我们提出的工作流程有效。相关代码已公开于 https://github.com/yuriYanZeXuan/GlyphBanana。
引用
@article{arxiv.2603.12155,
title = {GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows},
author = {Zexuan Yan and Jiarui Jin and Yue Ma and Shijian Wang and Jiahui Hu and Wenxiang Jiao and Yuan Lu and Linfeng Zhang},
journal= {arXiv preprint arXiv:2603.12155},
year = {2026}
}