UniCTokens:通过统一概念标记提升个性化理解与生成
计算机视觉与模式识别
2025-10-21 v3
摘要
个性化模型在理解和生成用户提供的概念方面已显示出显著成功。然而,现有方法为理解和生成分别使用独立的概念标记,将这两项任务视为孤立的,这可能导致生成复杂提示的受限。例如,给定概念 ,若不额外描述其帽子,即可生成“ 戴着帽子”。我们称此类生成为"\textit{个性化属性推理生成}"。为此,我们提出 UniCTokens,一种新型框架,有效整合个性化信息于统一的视觉语言模型 (VLM) 中,以提升理解与生成。UniCTokens 在训练一组统一概念标记以充分利用互补语义方面,显著提升这两项个性化任务。此外,我们提出分阶段训练策略:理解预热、从理解生成引导、从生成深化理解,以增强两项任务之间的相互作用。为定量评估统一 VLM 个性化,我们引入 UnifyBench,这是首个用于评估概念理解、概念生成及属性推理生成的基准。UnifyBench 上的实验表明,UniCTokens 在概念理解、概念生成方面表现与领先方法相当,并在个性化属性推理生成方面实现最先进的成绩。我们的研究表明,增强的理解可提升生成,而生成过程也能为理解提供宝贵见解。我们的代码和数据集将在 https://github.com/arctanxarc/UniCTokens 上公开。
引用
@article{arxiv.2505.14671,
title = {UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens},
author = {Ruichuan An and Sihan Yang and Renrui Zhang and Zijun Shen and Ming Lu and Gaole Dai and Hao Liang and Ziyu Guo and Shilin Yan and Yulin Luo and Bocheng Zou and Chaoqun Yang and Wentao Zhang},
journal= {arXiv preprint arXiv:2505.14671},
year = {2025}
}