用于场景图生成的自监督关系对齐
计算机视觉与模式识别
2023-12-14 v2
摘要
场景图生成的目标是从输入图像预测图,其中节点对应于已识别并定位的对象,边对应于它们对应的交互谓词。现有方法以全监督方式训练,并聚焦于消息传递机制、损失函数和/或偏差缓解。在本工作中,我们引入一种简单而有效的自监督关系对齐正则化,旨在提升场景图生成性能。所提出的对齐具有通用性,可与任何现有场景图生成框架结合,并与其原始模型目标一同训练。该对齐通过蒸馏实现,其中设计了一个辅助关系预测分支,其镜像并共享监督对应部分的参数。在辅助分支中,关系输入特征在消息传递和谓词预测之前被部分掩码。随后,掩码关系的预测在消息传递之后与监督对应部分对齐。我们展示了该自监督关系对齐与两种场景图生成架构 SGTR 和 Neural Motifs 结合时的有效性,并表明在两种情况下均实现了显著性能提升。
引用
@article{arxiv.2302.01403,
title = {Self-Supervised Relation Alignment for Scene Graph Generation},
author = {Bicheng Xu and Renjie Liao and Leonid Sigal},
journal= {arXiv preprint arXiv:2302.01403},
year = {2023}
}