用于无偏场景图生成的视觉关系Transformer
计算机视觉与模式识别
2023-08-21 v1 人工智能
摘要
近年来,场景图生成(SGG)作为一项全面的视觉场景理解任务日益受到关注,其目标是在目标编码器-解码器骨干之上堆叠关系编码器-解码器流水线来预测实体关系。遗憾的是,当前SGG方法在关系编码过程中存在实体局部级线索的信息丢失。为缓解此问题,我们引入了视觉关系Transformer(VETO,Vision rElation TransfOrmer),其由一种新颖的局部级实体关系编码器组成。我们进一步观察到,许多现有SGG方法声称无偏,但仍偏向头部或尾部类别。为克服该偏差,我们引入互斥专家(MEET,Mutually Exclusive ExperT)学习策略,在不偏向头部或尾部类别的情况下捕获重要关系特征。在VG和GQA数据集上的实验结果表明,VETO + MEET将预测性能较最先进水平提升多达47个百分点,同时模型体积小10倍。
引用
@article{arxiv.2308.09472,
title = {Vision Relation Transformer for Unbiased Scene Graph Generation},
author = {Gopika Sudhakaran and Devendra Singh Dhami and Kristian Kersting and Stefan Roth},
journal= {arXiv preprint arXiv:2308.09472},
year = {2023}
}
备注
Accepted for publication in ICCV 2023