中文

扩放人类活动识别:合成数据生成与增强技术的比较评估

计算机视觉与模式识别 2025-06-16 v2

摘要

人类活动识别 (HAR) 常因标注数据稀缺受限,因而面临高昂昂费和复杂的数据收集。为缓解此问题,近期研究探索了通过跨模态迁移生成虚拟惯性测量单位 (IMU) 数据。尽管视频基和语言基管道各自显示出前景,但它们在假设和计算成本方面存在差异,且其相对于传统传感器级数据增强的有效性尚不明了。本文对比了这两种虚拟 IMU 生成方法与经典数据增强技术。我们构建了大规模虚拟 IMU 数据集,涵盖 100 种来自 Kinetics-400 的多样化活动,并在 22 个身体部位模拟传感器信号。对这三种数据生成策略在基准 HAR 数据集 (UTD-MHAD、PAMAP2、HAD-AW) 上的效果进行评估,使用四种流行模型。结果表明,虚拟 IMU 数据在提升性能方面显著优于真实或增强数据,尤其在数据有限的情况下。我们提供了在数据生成策略方面进行选择的实用指导,并突出了每种方法的独特优势与不足。

关键词

引用

@article{arxiv.2506.07612,
  title  = {Scaling Human Activity Recognition: A Comparative Evaluation of Synthetic Data Generation and Augmentation Techniques},
  author = {Zikang Leng and Archith Iyer and Thomas Plötz},
  journal= {arXiv preprint arXiv:2506.07612},
  year   = {2025}
}