AGSwap:通过自适应组交换克服物体融合中的类别边界
计算机视觉与模式识别
2025-09-30 v2
摘要
由于在虚拟现实、数字媒体、电影和游戏中的广泛应用,将跨类别物体融合为单一连贯物体在文本到图像(T2I)生成中受到越来越多的关注。然而,由于重叠伪影和整合不佳,现有方法通常会产生有偏差的、视觉混乱的或语义不一致的结果。此外,由于缺乏全面的基准数据集,该领域的进展受到限制。为了解决这些问题,我们提出了自适应组交换(Adaptive Group Swapping, AGSwap),这是一种简单但非常有效的方法,包含两个关键组件:(1)分组嵌入交换,通过特征操作融合来自不同概念的语义属性;(2)自适应组更新,一种由平衡评估分数引导的动态优化机制,以确保连贯的合成。此外,我们引入了跨类别物体融合(Cross-category Object Fusion, COF),这是一个基于ImageNet-1K和WordNet构建的大规模、层次化结构数据集。COF包含95个超类,每个超类有10个子类,可实现451,250个独特的融合对。大量实验表明,AGSwap优于最先进的组合式T2I方法,包括使用简单和复杂提示的GPT-Image-1。
引用
@article{arxiv.2509.18699,
title = {AGSwap: Overcoming Category Boundaries in Object Fusion via Adaptive Group Swapping},
author = {Zedong Zhang and Ying Tai and Jianjun Qian and Jian Yang and Jun Li},
journal= {arXiv preprint arXiv:2509.18699},
year = {2025}
}
备注
Accepted to SIGGRAPH Asia 2025