中文

面向长尾动态场景图生成的多标签元加权方法

计算机视觉与模式识别 2023-06-21 v1

摘要

本文研究视频中的场景图生成问题,旨在以\langle主体, 谓词, 客体\rangle三元组形式捕捉主体与客体间的语义关系。识别主体与客体对之间的谓词本质上具有不平衡与多标签特性,从普遍存在的空间关系(如\emph{在……前面})到罕见交互(如\emph{扭转})。在Action Genome和VidOR等广泛使用的基准中,最频繁与最不频繁谓词之间的不平衡比分别达到3218和3408,甚至超过专为长尾识别设计的基准。由于长尾分布与标签共现,近期最先进方法主要关注最频繁出现的谓词类,忽略长尾中的那些。本文分析当前视频场景图生成方法的局限,并识别出谓词频率与召回性能间的一一对应关系。为迈向无偏视频场景图生成,我们引入多标签元学习框架以应对有偏谓词分布。我们的元学习框架针对每个训练样本在所有可能标签损失上学习一个元权重网络。我们基于各基准的两种当前最先进方法,在Action Genome和VidOR基准上评估所提方法。实验表明,多标签元权重网络在不损害头部类性能的前提下提升长尾谓词性能,从而获得更优整体性能与良好泛化性。代码:\url{https://github.com/shanshuo/ML-MWN}。

关键词

引用

@article{arxiv.2306.10122,
  title  = {Multi-Label Meta Weighting for Long-Tailed Dynamic Scene Graph Generation},
  author = {Shuo Chen and Yingjun Du and Pascal Mettes and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2306.10122},
  year   = {2023}
}

备注

ICMR 2023