中文

统一的个人化理解、生成与编辑

计算机视觉与模式识别 2026-01-13 v1

摘要

统一的大型多模态模型(LMM)在通用用途的多模态理解和生成方面取得了显著进展。然而,它们仍遵循“适用于所有情况”的范式,难以以一致且可控的方式建模用户特定概念(例如生成图片 \texttt{<maeve>})。现有的个人化方法通常依赖外部检索,效率低下且未能有效集成到统一的多模态管道中。最近出现的个人化统一模型引入可学习的软提示来编码概念信息,但要么将理解与生成耦合,要么依赖复杂的多阶段训练,导致跨任务干扰并最终导致个人化知识模糊或不一致。我们提出了 **OmniPersona**,一种用于统一LMM的端到端个人化框架,首次将个人化理解、生成和图像编辑集成到单一架构中。OmniPersona引入结构解耦的概念标记,为不同任务分配专用子空间以最小化干扰,并纳入显式的知识重放机制,将个人化属性知识在任务之间传播,从而实现一致的个人化行为。为系统评估统一个人化,我们提出了 **\texttt{OmniPBench}**,在公开的 UnifyBench 概念集合上扩展了个人化编辑任务和跨任务评估协议,集成理解、生成和编辑。实验结果表明,OmniPersona 在多样化的个人化任务中 delivers competitive and robust performance。我们希望OmniPersona将成为可控统一个人化的强基准,并催发进一步的研究。

关键词

引用

@article{arxiv.2601.06965,
  title  = {Unified Personalized Understanding, Generating and Editing},
  author = {Yu Zhong and Tianwei Lin and Ruike Zhu and Yuqian Yuan and Haoyu Zheng and Liang Liang and Wenqiao Zhang and Feifei Shao and Haoyuan Li and Wanggui He and Hao Jiang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2601.06965},
  year   = {2026}
}