TokenAR:基于自回归 Token 级增强的多主体生成
计算机视觉与模式识别
2025-10-21 v1
摘要
自回归模型 (AR) 在条件图像生成方面表现突出。然而,这些方法在多参考生成方面 struggles with 解耦不同参考身份。在本工作中,我们提出了 TokenAR 框架,专注于一种简单但有效的 token 级增强机制,以解决参考身份混淆问题。这种 token 级增强包括三个部分:1)Token Index Embedding 将 token 索引聚类,以更好地表示相同的参考图像;2)Instruct Token Injection 充当额外视觉特征容器,以注入参考 token 的详细且互补的先验;3)身份-token 解耦策略 (ITD) 明确引导 token 表示独立地表示每个身份的特征。这种 token 增强框架显著增强了现有 AR 方法在条件图像生成中的能力,使其在保持高质量背景重建的同时实现良好的身份一致性。为了实现高质量和高多样性的多主体生成,我们引入了 InstructAR 数据集,这是第一个开源的、大规模的、多参考输入、开放领域的图像生成数据集,包含 28K 训练对,每个示例包含两个参考主体、一个相对提示和带掩码注释的背景,专为多参考图像生成训练和评估。全面实验表明,我们的方法在多参考图像生成任务中超越了当前最先进的模型。实现代码和数据集将公开发布。代码已提供,见 https://github.com/lyrig/TokenAR
引用
@article{arxiv.2510.16332,
title = {TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement},
author = {Haiyue Sun and Qingdong He and Jinlong Peng and Peng Tang and Jiangning Zhang and Junwei Zhu and Xiaobin Hu and Shuicheng Yan},
journal= {arXiv preprint arXiv:2510.16332},
year = {2025}
}