中文

学习解耦标识符以实现动作定制化的文本到图像生成

计算机视觉与模式识别 2024-05-13 v5

摘要

本研究关注文本到图像(T2I)生成中的一项新任务,即动作定制化。该任务的目标是从有限数据中学习共存动作,并将其泛化至未见过的自然人甚至动物。实验结果表明,现有的主体驱动定制化方法无法学习动作的代表性特征,且难以将动作与包括外观在内的上下文特征解耦。为克服对低级特征的偏好以及高级特征的纠缠,我们提出一种基于反演的方法——动作解耦标识符(ADI),从示例图像中学习动作特定标识符。ADI 首先通过引入分层标识符令牌扩展语义条件空间,从而在增加表征丰富度的同时将反演分布到不同特征上。接着,为阻断动作无关特征的反演,ADI 从构建的样本三元组中提取梯度不变性,并掩码无关通道的更新。为全面评估该任务,我们提出了 ActionBench,其包含多种动作,每种均配有精心筛选的样本。定量与定性结果均表明,我们的 ADI 在动作定制化 T2I 生成上优于现有基线。我们的项目页面位于 https://adi-t2i.github.io/ADI。

关键词

引用

@article{arxiv.2311.15841,
  title  = {Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation},
  author = {Siteng Huang and Biao Gong and Yutong Feng and Xi Chen and Yuqian Fu and Yu Liu and Donglin Wang},
  journal= {arXiv preprint arXiv:2311.15841},
  year   = {2024}
}

备注

CVPR 2024