利用辅助文本深度识别未见视觉关系
计算机视觉与模式识别
2019-10-29 v1
摘要
场景理解中最困难的任务之一是识别图像中物体之间的交互。该任务常被称为视觉关系检测(VRD)。我们考虑如下问题:在用于训练 VRD 模型的标准视觉数据之外,给定辅助文本数据,能否提升 VRD 性能。我们提出一种可利用额外文本数据的新深度模型。我们的模型依赖于出现在文本中的主谓宾关系与图像中物体交互的共享文本—图像表示。我们的方法是首个能够识别视觉训练数据中缺失、仅出现在辅助文本中的视觉关系的方法。我们在两种不同的文本来源上测试了我们的方法:源自图像的文本和源自书籍的文本。我们使用两个大规模识别任务——VRD 和场景图生成(Scene Graph Generation)——对方法进行测试与验证。我们展示了一个令人惊讶的结果:我们的方法在源自书籍的文本上表现更好,并在未见关系识别任务上优于源自图像的文本。在已见关系识别任务上,它与利用源自图像的文本的模型表现相当。
引用
@article{arxiv.1910.12324,
title = {Leveraging Auxiliary Text for Deep Recognition of Unseen Visual Relationships},
author = {Gal Sadeh Kenigsfield and Ran El-Yaniv},
journal= {arXiv preprint arXiv:1910.12324},
year = {2019}
}