面向动作识别的视频测试时自适应
计算机视觉与模式识别
2023-03-22 v3
摘要
尽管动作识别系统在分布内测试点上进行评估时可以达到顶级性能,但它们容易受到测试数据中预料之外的分布偏移的影响。然而,针对常见分布偏移的视频动作识别模型的测试时自适应,迄今为止尚未得到验证。我们提出用一种为时空模型量身定制的方法来解决这个问题,该方法能够在单个视频样本上逐步进行自适应。它包含一种特征分布对齐技术,该技术将测试集统计量的在线估计向训练统计量对齐。我们进一步对同一测试视频样本的时间增强视图施加预测一致性。在三个基准动作识别数据集上的评估表明,我们提出的技术是架构无关的,并且能够显著提升最先进的卷积架构 TANet 和 Video Swin Transformer 的性能。我们提出的方法在单一分布偏移和具有挑战性的随机分布偏移评估中,都展示了相对于现有测试时自适应方法的显著性能增益。代码将发布于 \url{https://github.com/wlin-at/ViTTA}。
引用
@article{arxiv.2211.15393,
title = {Video Test-Time Adaptation for Action Recognition},
author = {Wei Lin and Muhammad Jehanzeb Mirza and Mateusz Kozinski and Horst Possegger and Hilde Kuehne and Horst Bischof},
journal= {arXiv preprint arXiv:2211.15393},
year = {2023}
}
备注
Accepted at CVPR 2023