MONKEY:基于关键值激活遮蔽适配器的个人化
计算机视觉与模式识别
2026-01-21 v3
摘要
personalizing diffusion models 允许用户生成包含给定主体的新图像,比文本提示符提供更大的控制力。这些模型在最终仅重现主体图像而忽略文本提示符时会出现一些问题。我们注意到,IP-Adapter 在推理过程中会自动生成将主体从背景中分离的掩码。我们提议在第二次pass中对图像标记使用该自动生成的掩码,从而将其限制在主体上,允许文本提示符关注图像的其余部分。对于描述位置和地点的文本提示,这会生成准确描绘主体并确定性匹配提示符的图像。我们将方法与几种其他测试时间 personalisation 方法进行比较,发现该方法在提示符和源图像对齐方面表现出色。我们还进行了用户研究以验证最终用户是否会欣赏该方法。代码可在 https://github.com/jamesBaker361/monkey 获取。
引用
@article{arxiv.2510.07656,
title = {MONKEY: Masking ON KEY-Value Activation Adapter for Personalization},
author = {James Baker},
journal= {arXiv preprint arXiv:2510.07656},
year = {2026}
}