面向开放词汇场景图生成的交互中心知识注入与迁移
计算机视觉与模式识别
2025-11-11 v1
摘要
开放词汇场景图生成(OVSGG)通过识别超出预定义类别的新颖对象与关系,利用来自大规模预训练模型的知识,扩展了传统场景图生成。现有 OVSGG 方法始终采用两阶段流程:1)通过在大规模数据集上进行预训练将知识注入到大规模模型中;2)在完全标注的场景图上进行监督微调,将知识从预训练模型中迁移。然而,由于缺乏显式的交互建模,这些方法难以区分相同对象类别的交互与非交互实例。此限制在 OVSGG 的两个阶段引发严重问题:知识注入时生成来自不匹配对象的噪声伪监督,知识迁移时导致查询匹配模糊。为此,本文提出一种以交互为导向的端到端 OVSGG 框架——ACC(Interaction-Centric),以交互驱动范式最小化这些不匹配。对于“交互中心知识注入”,ACC 采用双向交互提示实现稳健的伪监督生成,以增强模型的交互知识。对于“交互中心知识迁移”,ACC 首先采用交互引导查询选择,优先配对交互对象以减少非交互对象的干扰。随后,它整合交互一致的知识蒸馏,以通过将关系前景推远离背景而保持一般知识来增强鲁棒性。大量实验表明,ACC 在三个基准数据集上实现了最先进的性能,展示了交互中心范式在实际应用中的潜力。
引用
@article{arxiv.2511.05935,
title = {Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation},
author = {Lin Li and Chuhan Zhang and Dong Zhang and Chong Sun and Chen Li and Long Chen},
journal= {arXiv preprint arXiv:2511.05935},
year = {2025}
}
备注
Accepted by NeurIPS 2025