缓解动作识别中的表征偏差:算法与基准
计算机视觉与模式识别
2022-09-21 v1
摘要
深度学习模型在大规模视频基准上取得了优异的识别结果。然而,当应用于包含罕见场景或物体的视频时,它们表现不佳,这主要归因于现有视频数据集的偏差。我们从算法和数据集两个不同角度解决此问题。从算法角度,我们提出空间感知多方面去偏(SMAD),它结合了基于多方面对抗训练的显式去偏与基于空间动作性重加权模块的隐式去偏,以学习对非动作方面不变的更具通用性的表征。为中和数据集的内在偏差,我们提出 OmniDebias,选择性地利用网络数据进行联合训练,能以远少的网络数据实现更高性能。为验证有效性,我们建立了评估协议,并在现有数据集的重新划分子集以及一个聚焦于罕见场景动作的新评估数据集上进行了大量实验。我们还表明,去偏表征在迁移到其他数据集和任务时具有更好的泛化能力。
引用
@article{arxiv.2209.09393,
title = {Mitigating Representation Bias in Action Recognition: Algorithms and Benchmarks},
author = {Haodong Duan and Yue Zhao and Kai Chen and Yuanjun Xiong and Dahua Lin},
journal= {arXiv preprint arXiv:2209.09393},
year = {2022}
}
备注
ECCVW 2022