中文

ReMA:一种无需训练的视频行为识别可混合数据增强

计算机视觉与模式识别 2026-01-05 v1

摘要

视频行为识别需要在复杂时空变化下保持稳定且具辨识力的表征。然而,现有的视频数据增强策略仍主要依赖扰动驱动,常常引入不可控制的变化,从而放大非辨识因素,最终削弱类内分布结构并在时间尺度上表现不一致。为此,我们提出表征感知混合增强 (ReMA),一种即插即用的数据增强策略,将混合形式化为受控替换过程,以扩展表征同时保持类条件稳定性。ReMA 集成了两种互补机制。首先,表征对齐机制 (RAM) 在分布对齐约束下进行结构化类内混合,抑制无关的类内漂移同时增强统计可靠性。随后,动态选择机制 (DSM) 生成感知运动的时空掩码,以局部化扰动,引导它们远离辨识敏感区域并促进时序一致性。通过统一控制混合的如何及其何处应用,ReMA 在无需额外监督或可训练参数的情况下提高了表征的鲁棒性。广泛的实验表明,在多样化的视频行为基准测试上,ReMA 在不同时空细节尺度上 consistently 提升了泛化性和鲁棒性。

关键词

引用

@article{arxiv.2601.00311,
  title  = {ReMA: A Training-Free Plug-and-Play Mixing Augmentation for Video Behavior Recognition},
  author = {Feng-Qi Cui and Jinyang Huang and Sirui Zhao and Jinglong Guo and Qifan Cai and Xin Yan and Zhi Liu},
  journal= {arXiv preprint arXiv:2601.00311},
  year   = {2026}
}