中文

MIFO:从单张图像学习与合成多实例

计算机视觉与模式识别 2025-11-04 v1

摘要

本文提出一种方法,实现对单张图像中多实例语义的精准学习与合成。该问题的难点在于训练数据有限,若待学习的实例语义或外观相似,挑战更为严峻。为此,我们提出基于惩罚的注意力优化,以在学习阶段解耦相似语义。随后,在合成阶段,我们引入并优化注意力层中的框控机制,以进一步缓解语义泄漏,同时精确控制输出布局。实验结果表明,我们的方法实现了解耦且高质量的语义学习与合成,在可编辑性与实例一致性之间取得了显著平衡。当处理语义或视觉相似的实例或稀有目标时,我们的方法仍能保持鲁健性。代码已公开于 https://github.com/Kareneveve/MIFO

关键词

引用

@article{arxiv.2511.00542,
  title  = {MIFO: Learning and Synthesizing Multi-Instance from One Image},
  author = {Kailun Su and Ziqi He and Xi Wang and Yang Zhou},
  journal= {arXiv preprint arXiv:2511.00542},
  year   = {2025}
}

备注

17 pages, 30 figures