中文

基于语义感知的单图像贴纸个性化方法 SEAL

计算机视觉与模式识别 2026-04-30 v1

摘要

在基于扩散模型的个性化文本到图像生成中,单参考图像合成目标概念具有挑战性,尤其是贴纸个性化领域,提示往往需要显式的属性编辑。仅使用一个参考图像,测试时微调(TTF)方法倾向于过拟合,产生视觉纠缠(背景灰尘被吸收到已学习概念中)和结构刚性(模型记忆参考特定的空间配置,丧失上下文可控性)。为解决这些问题,我们引入了基于语义的单图像贴纸个性化方法(SEAL),这是一种即插即用、架构无关的适应模块,可集成到现有的个性化管道中,而无需修改其基于 U-Net 的扩散主干。SEAL 在嵌入适应期间应用三个组件:(1)语义引导的空间注意力损失、(2)分裂合并标记策略、(3)结构感知的层级限制。为支持贴纸领域的个性化并实现属性级别的控制,我们提出了 StickerBench,一个大型贴纸图像数据集,包含基于六个属性模式(外观、情感、动作、摄影构图、风格、背景)的结构化标签。这些注释提供了在保持目标身份固定的同时,对不同上下文进行一致性接口的能力,使系统化评估身份解耦和上下文可控性成为可能。实验表明,SEAL 在保持上下文可控性的同时,持续改进了身份保留,凸显了测试时适应期间对显式空间和结构约束的重要性。该代码、数据集和项目页面将公开发布。

关键词

引用

@article{arxiv.2604.26883,
  title  = {SEAL: Semantic-aware Single-image Sticker Personalization with a Large-scale Sticker-tag Dataset},
  author = {Changhyun Roh and Yonghyun Jeong and Jonghyun Lee and Chanho Eom and Jihyong Oh},
  journal= {arXiv preprint arXiv:2604.26883},
  year   = {2026}
}

备注

The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/SEAL