面向无偏场景图生成的上下文感知混合专家模型
计算机视觉与模式识别
2023-01-03 v3
摘要
场景图生成(SGG)近年来取得了巨大进展。然而,其底层谓词类的长尾分布是一个具有挑战性的问题。对于极度不平衡的谓词分布,现有方法通常构建复杂的上下文编码器以提取场景上下文与谓词的内在关联,并设计复杂网络以提升模型对高度不平衡谓词分布的学习能力。为解决无偏 SGG 问题,我们引入了一种简单而有效的方法,称为上下文感知混合专家(CAME),以在不复杂设计的情况下提升模型多样性并缓解有偏 SGG。具体而言,我们提出将混合专家与分治集成策略相整合,以补救谓词类严重的长尾分布,该方法适用于绝大多数无偏场景图生成器。由此有偏 SGG 得以减轻,模型倾向于预测更均匀分布的谓词。为区分不同谓词分布层级,权重相同的专家尚不足以具备充分多样性。为使网络动态利用丰富场景上下文并进一步提升模型多样性,我们仅使用内置模块构建上下文编码器。各专家对场景上下文的重要性以及各谓词对各专家的重要性通过专家加权(EW)与谓词加权(PW)策略动态关联。我们在 Visual Genome 数据集上针对三项任务进行了大量实验,表明 CAME 优于近期方法并达到了最先进性能。我们的代码将公开可用。
引用
@article{arxiv.2208.07109,
title = {Context-aware Mixture-of-Experts for Unbiased Scene Graph Generation},
author = {Liguang Zhou and Yuhongze Zhou and Tin Lun Lam and Yangsheng Xu},
journal= {arXiv preprint arXiv:2208.07109},
year = {2023}
}