以局部到全局交互应对场景图生成中的挑战
计算机视觉与模式识别
2022-04-13 v3
摘要
在本工作中,我们寻求对场景图生成(SGG)任务潜在挑战的新见解。对 Visual Genome 数据集的定量与定性分析表明——1)歧义性:即便物体间关系包含相同物体(或谓词),它们在视觉或语义上也可能并不相似;2)不对称性:尽管关系本身具有方向性,但先前研究未能很好地处理;3)高阶上下文:利用某些图元素的身份有助于生成准确的场景图。受该分析启发,我们设计了一种新颖的 SGG 框架,即局部到全局交互网络(LOGIN)。在局部,交互提取主体、客体和背景这三个实例之间的本质,同时通过显式约束主体与客体的输入顺序将方向感知融入网络。在全局,交互编码每个图组件(即节点与边)之间的上下文。最后,利用吸引与排斥损失来微调谓词嵌入的分布。凭借该设计,我们的框架能够以自底向上的方式预测场景图,利用可能的互补性。为量化 LOGIN 对关系方向的感知程度,我们还提出了一种称为双向关系分类(BRC)的新诊断任务。实验结果表明,LOGIN 比现有方法(在 BRC 任务中)能成功区分关系方向,同时在 Visual Genome 基准(SGG 任务中)取得了最先进的结果。
引用
@article{arxiv.2106.08543,
title = {Tackling the Challenges in Scene Graph Generation with Local-to-Global Interactions},
author = {Sangmin Woo and Junhyug Noh and Kangil Kim},
journal= {arXiv preprint arXiv:2106.08543},
year = {2022}
}
备注
IEEE Transactions on Neural Networks and Learning Systems (TNNLS)