中文

TD^2-Net:面向动态场景图生成的去噪与去偏

计算机视觉与模式识别 2024-01-24 v1

摘要

动态场景图生成(SGG)专注于检测视频中的物体并确定其成对关系。现有的动态 SGG 方法通常存在若干问题,包括:1)上下文噪声,因为某些帧可能包含被遮挡和模糊的物体;2)标签偏差,主要由于少数正关系样本与大量负样本之间的高度不平衡。此外,关系的分布呈现长尾模式。为解决上述问题,本文提出了一种名为 TD2^2-Net 的网络,旨在对动态 SGG 进行去噪和去偏。具体而言,我们首先提出一个去噪时空 Transformer 模块,通过鲁棒的上下文信息增强物体表示。这是通过设计一个可微的 Top-K 物体选择器来实现的,该选择器利用 gumbel-softmax 采样策略为每个物体选择相关邻域。其次,我们引入一种非对称重加权损失来缓解标签偏差问题。该损失函数整合了非对称聚焦因子和样本量,以调整分配给各个样本的权重。系统的实验结果表明,我们提出的 TD2^2-Net 在 Action Genome 数据库上优于现有的最先进方法。更详细地说,在谓词分类的 mean-Recall@10 指标上,TD2^2-Net 比第二好的竞争者高出 12.7%。

关键词

引用

@article{arxiv.2401.12479,
  title  = {TD^2-Net: Toward Denoising and Debiasing for Dynamic Scene Graph Generation},
  author = {Xin Lin and Chong Shi and Yibing Zhan and Zuopeng Yang and Yaqi Wu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2401.12479},
  year   = {2024}
}

备注

Accepted by AAAI 2024