应对无标注问题:基于偏差削减模型的场景图生成
计算机视觉与模式识别
2020-08-19 v1 机器学习
摘要
预测捕获图像中视觉实体及其交互的场景图,已被视为实现完整场景理解的关键一步。近期的场景图生成(SGG)模型已展现出捕获视觉实体间最常见关系的能力。然而,最先进的结果仍远不能令人满意,例如在 Visual Genome (VG) 上,模型在整体召回率 R@100 上可获得 31%,而同样重要的平均类别召回率 mR@100 仅约 8%。R 与 mR 结果之间的差距促使研究重点从追求高 R 转向在 R 仍具竞争力的情况下追求高 mR。我们怀疑这种观察到的差距源于 VG 中的标注偏差和稀疏标注,其中许多视觉实体对要么完全未被标注,要么在多个关系可能有效时仅标注了单一关系。为解决这一特定问题,我们提出了一种利用自学习知识的新型 SGG 训练方案。它涉及两个关系分类器,其中一个为另一个提供偏差更小的设置作为基础。所提方案可应用于大多数现有 SGG 模型,且实现直接简便。我们观察到在所有标准 SGG 任务中,mR 获得显著相对提升(介于 +6.6% 和 +20.4% 之间),而 R 具竞争力或更好(介于 -2.4% 和 0.3% 之间)。
引用
@article{arxiv.2008.07832,
title = {Tackling the Unannotated: Scene Graph Generation with Bias-Reduced Models},
author = {Tzu-Jui Julius Wang and Selen Pehlivan and Jorma Laaksonen},
journal= {arXiv preprint arXiv:2008.07832},
year = {2020}
}
备注
accepted to BMVC2020