中文

SG-Shuffle:面向场景图生成的多方面混洗Transformer

计算机视觉与模式识别 2022-11-10 v1

摘要

场景图生成(SGG)为人类理解及视觉理解任务提供了图像的全面表示。由于可用标注数据中对象和谓词标签的长尾偏差问题,当前方法生成的场景图可能偏向于常见但信息量低的谓词标签。谓词有时并非互斥,可以从几何关系或语义关系等多个角度描述,这使得预测最合适的谓词标签更具挑战性。在这项工作中,我们提出了用于场景图生成的SG-Shuffle流水线,包含3个组件:1)并行Transformer编码器,通过将谓词标签分组为具有相似目的的组,以更具排他性的方式学习预测对象关系;2)混洗Transformer,学习从上一步生成的类别特定特征中选择最终的谓词标签;3)加权交叉熵损失,用于缓解由数据集不平衡导致的训练偏差。

关键词

引用

@article{arxiv.2211.04773,
  title  = {SG-Shuffle: Multi-aspect Shuffle Transformer for Scene Graph Generation},
  author = {Anh Duc Bui and Soyeon Caren Han and Josiah Poon},
  journal= {arXiv preprint arXiv:2211.04773},
  year   = {2022}
}