对抗增强训练使动作识别模型对真实视频分布偏移更具鲁棒性
计算机视觉与模式识别
2025-07-15 v2
摘要
尽管最近在视频动作识别方面取得了进展并在现有基准上实现了强大的性能,但这些模型在面对训练数据和测试数据之间的自然分布偏移时往往缺乏鲁棒性。我们提出了两种新颖的评估方法来评估模型对此类分布差异的弹性。一种方法使用从不同来源收集的两个不同数据集,并使用一个进行训练和验证,使用另一个进行测试。更准确地说,我们创建了 HMDB-51 或 UCF-101 的数据集划分用于训练,以及 Kinetics-400 用于测试,使用了在训练和测试数据集中均重叠的类别子集。另一种提出的方法从目标评估数据集的训练数据中提取每个类别的特征均值(即类别原型),并将测试视频预测估计为每个样本与每个目标类别的类别原型之间的余弦相似度得分。此过程不使用目标数据集更改模型权重,也不需要对齐两个不同数据集的重叠类别,因此是一种在无目标分布先验知识的情况下测试模型对分布偏移鲁棒性的非常有效的方法。我们通过对抗增强训练——通过在增强参数上应用梯度上升来生成对分类模型而言“困难”的视频增强视图——以及视频增强强度的“课程”调度来解决鲁棒性问题。我们在三种最先进的动作识别模型——TSM、Video Swin Transformer 和 Uniformer 上,通过实验证明了所提出的对抗增强方法优于基线的性能。所提出的工作为模型对分布偏移的鲁棒性提供了关键见解,并提出了在真实世界部署中增强视频动作识别性能的有效技术。
引用
@article{arxiv.2401.11406,
title = {Adversarial Augmentation Training Makes Action Recognition Models More Robust to Realistic Video Distribution Shifts},
author = {Kiyoon Kim and Shreyank N Gowda and Panagiotis Eustratiadis and Antreas Antoniou and Robert B Fisher},
journal= {arXiv preprint arXiv:2401.11406},
year = {2025}
}
备注
Accepted to ICPRAI 2024