利用谓词与三元组学习提升场景图生成
计算机视觉与模式识别
2024-06-05 v1
摘要
场景图生成 (SGG) 旨在识别视觉场景中的实体并预测关系三元组 \textit{\textless主体,谓词,客体\textgreater}。鉴于同一谓词下主体-客体对的视觉变异较大,directly across such pairs 来建模和细化谓词表征颇具挑战性,而这也是大多数现有 SGG 方法所采用的常规策略。我们观察到,同一三元组内部的视觉变异相对较小,且某些关系线索在同一类型的三元组中是共享的,这可能有助于促进 SGG 中的关系学习。此外,对于 SGG 任务中广泛关注的长尾问题,处理有限的尾部谓词/三元组类型和数量也至关重要。基于此,本文提出了双粒度关系建模 (DRM) 网络,以利用细粒度三元组线索辅助粗粒度谓词线索。DRM 利用谓词和三元组的上下文与语义,通过双粒度约束生成紧凑且平衡的表征,以便促进关系识别。进一步地,引入双粒度知识传递 (DKT) 策略,将头部谓词/三元组的变异传递给尾部谓词,以旨在丰富尾部类别的模式多样性以缓解长尾问题。大量实验表明,我们的方法在 Visual Genome、Open Image 和 GQA 数据集上建立了新的最先进技术水平。我们的代码可在 \url{https://github.com/jkli1998/DRM} 获取。
引用
@article{arxiv.2406.02038,
title = {Leveraging Predicate and Triplet Learning for Scene Graph Generation},
author = {Jiankai Li and Yunhong Wang and Xiefan Guo and Ruijie Yang and Weixin Li},
journal= {arXiv preprint arXiv:2406.02038},
year = {2024}
}
备注
CVPR 2024