用于短语定位的解耦 motif 感知图学习
计算机视觉与模式识别
2021-04-14 v1 计算与语言
摘要
在本文中,我们提出了一种用于图像中短语定位的新型图学习框架。从序列模型发展到稠密图模型,现有工作捕捉了粗粒度上下文,但未能区分短语与图像区域之间上下文的多样性。相比之下,我们特别关注场景图上下文中隐含的不同 motif,并设计了解耦图网络,将 motif 感知的上下文信息整合到表示中。此外,我们在特征层和结构层采用干预策略以巩固和泛化表示。最后,利用跨模态注意力网络融合模态内特征,其中每个短语可与区域计算相似度以选择最佳定位区域。我们通过一系列消融研究验证了解耦与干预图网络(DIGN)的有效性,并且我们的模型在 Flickr30K Entities 和 ReferIt Game 基准上取得了最先进的性能。
引用
@article{arxiv.2104.06008,
title = {Disentangled Motif-aware Graph Learning for Phrase Grounding},
author = {Zongshen Mu and Siliang Tang and Jie Tan and Qiang Yu and Yueting Zhuang},
journal= {arXiv preprint arXiv:2104.06008},
year = {2021}
}
备注
10 pages, 6 figures, AAAI 2021 conference