SSR-Encoder:编码选择性主体表示用于主体驱动生成
计算机视觉与模式识别
2024-03-15 v2
摘要
近期主体驱动图像生成取得了零样本生成的进展,但精确选择和聚焦关键主体表示仍具挑战性。为此,我们引入SSR-Encoder,一种新颖架构,旨在从单张或多张参考图像中选择性地捕捉任何主体。它响应包括文本和掩码在内的多种查询模态,无需测试时微调。SSR-Encoder结合了Token-to-Patch Aligner(将查询输入与图像块对齐)和Detail-Preserving Subject Encoder(用于提取和保留主体的精细特征),从而生成主体嵌入。这些嵌入与原始文本嵌入一起用于条件生成过程。SSR-Encoder具有模型通用性和高效性,可适应多种自定义模型和控制模块。通过嵌入一致性正则化损失增强训练,我们的广泛实验证明了其在多样化和高质量图像生成中的有效性,表明其广泛适用性。项目页面:https://ssr-encoder.github.io
引用
@article{arxiv.2312.16272,
title = {SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven Generation},
author = {Yuxuan Zhang and Yiren Song and Jiaming Liu and Rui Wang and Jinpeng Yu and Hao Tang and Huaxia Li and Xu Tang and Yao Hu and Han Pan and Zhongliang Jing},
journal= {arXiv preprint arXiv:2312.16272},
year = {2024}
}