中文

一个有创意的智能体等价于 64 个标记的模板

计算机视觉与模式识别 2026-03-19 v1

摘要

文本到图像 (T2I) 模型在图像保真度和提示遵循性方面取得了显著提升,但其创造力仍受限于依赖离散自然语言提示。当面对诸如“一个灵感来源于黑胶唱片的摩天大楼”这样的模糊提示时,这些模型常常无法推断出潜在的创意意图,导致创意构思和提示设计主要依赖人类用户。近期的基于推理或智能体的方法会不断增强提示,但会产生高昂的计算和 monetary 成本,因为其面向特定实例的生成方式使得“创意”成本高昂且不可重用,需要为后续生成反复查询或推理。为此,我们引入了 **CAT** 框架,即 **C**reative **A**gent **T**okenization,以封装智能体对“创意”内在理解的 **Creative Tokenizer**。给定模糊提示的嵌入表示,tokenizer 会生成一个可重用的标记模板,可直接拼接到提示中,以无需重复推理或提示增强的方式将创意语义注入 T2I 模型。为实现此目标,tokenizer 通过创意语义解耦进行训练,利用部分重叠概念对之间的关系,以捕捉智能体潜在的创意表征。针对 **Architecture Design**、**Furniture Design** 和 **Nature Mixture** 三个任务进行了广泛实验,表明 CAT 提供了一种可扩展且有效的范式,用于增强 T2I 生成的创造力,实现了 3.7×3.7\times 的加速和 4.8×4.8\times 的计算成本降低,同时生成的图像在人类偏好和文本-图像对齐方面优于最先进的 T2I 模型和创意生成方法。

关键词

引用

@article{arxiv.2603.17895,
  title  = {A Creative Agent is Worth a 64-Token Template},
  author = {Ruixiao Shi and Fu Feng and Yucheng Xie and Xu Yang and Jing Wang and Xin Geng},
  journal= {arXiv preprint arXiv:2603.17895},
  year   = {2026}
}