基于场景图引导的扩散模型用于图像协作分段标注
计算机视觉与模式识别
2025-12-02 v1
摘要
可控图像语义理解任务(如标注或分段)需要用户输入提示(如文本或边界框)以预测唯一结果,带来诸多挑战,如高成本提示输入或有限信息输出。本文引入新任务“图像协作分段标注”(SegCaptioning),旨在将简单的提示(如围绕目标的边界框)转化为由(标注、掩码)对表示的多样化语义解释,允许用户灵活选择结果。该任务面临显著挑战,包括从最小提示准确捕获用户意图,同时预测多个语义对齐的标注词和掩码。技术上,我们提出一种场景图引导扩散模型,利用结构化场景图特征进行关联掩码-标注预测。首先,我们引入提示中心场景图适配器,将用户提示映射到场景图,有效捕获其意图。随后,我们采用包含场景图引导双模态变换器的扩散过程,预测关联的标注-掩码对,通过揭示它们之间的复杂关联。为确保准确对齐,我们设计多实体对比学习损失,显式考虑跨模态相似性,对视觉和文本实体进行对齐,产生对齐良好的标注-掩码对。在两个数据集上的大量实验表明,SGDiff 在 SegCaptioning 任务中取得优异性能,为仅需少量提示输入的情况下在标注和分段任务中取得有前景的结果。
引用
@article{arxiv.2512.01975,
title = {SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning},
author = {Xu Zhang and Jin Yuan and Hanwang Zhang and Guojin Zhong and Yongsheng Zang and Jiacheng Lin and Zhiyong Li},
journal= {arXiv preprint arXiv:2512.01975},
year = {2025}
}
备注
Accept by AAAI-2025