中文

视频关系检测器中的错误诊断

计算机视觉与模式识别 2021-10-26 v1

摘要

视频关系检测构成了计算机视觉中一个新颖且具有挑战性的问题,其中需要对主体和客体进行时空定位,并且当且仅当两者之间存在交互时才需赋予谓词标签。尽管视频关系检测近期取得了进展,总体性能仍然有限,且解决问题的关键因素仍不明确。遵循目标检测与动作定位文献中的先例,我们深入探究当前视频关系检测方法的错误诊断。我们引入了一种用于分析检测错误来源的诊断工具。该工具通过定义特定于视频关系检测、用于假阳性分析的不同错误类型,超越平均精度均值这一单一标量指标来评估和比较当前方法。此外,我们在假阴性分析中考察了影响性能的若干因素,包括关系长度、主体/客体/谓词实例数量以及主体/客体尺寸。最后,我们展示了针对每种错误类型采用预言机修正时对视频关系性能的影响。在两个视频关系基准上,我们揭示了当前方法的优势与不足,从而能够指出该领域最重要的未来方向。该工具可在 \url{https://github.com/shanshuo/DiagnoseVRD} 获取。

关键词

引用

@article{arxiv.2110.13110,
  title  = {Diagnosing Errors in Video Relation Detectors},
  author = {Shuo Chen and Pascal Mettes and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2110.13110},
  year   = {2021}
}

备注

BMVC 2021