中文

BenchHAR:面向通用传感器-based活动识别的自监督学习基准

计算机视觉与模式识别 2026-05-12 v1 信号处理

摘要

从可穿戴传感器进行人类活动识别(HAR)支持广泛的医疗保健和行为科学应用。然而,数据异构性和标注数据稀缺限制了其在现实世界中的泛化能力。近期在视觉和语言领域的自监督学习(SSL)研究表明,SSL方法在从无标签数据中学习通用表征具有强大的能力。然而,少数研究系统比较了SSL方法的泛化性能,或探讨了如何将其应用于通用HAR。为此,我们提出BenchHAR——一个用于评估SSL方法在未见目标分布下针对传感器-based活动识别泛化能力的统一框架。BenchHAR策划了大规模数据集(约25.8万样本),并在12种编码器-分类器架构上评估了八种具有代表性的SSL方法。我们的结果揭示,现有SSL方法在实现令人满意的泛化性能方面存在挑战。我们发现:(1)对于HAR模型,混合范式(结合重建和对比式预训练)实现了最佳整体性能。CNN编码器展现出学习通用表征的最强能力,而更具表现力的分类器架构进一步提升了泛化能力。(2)在数据规模方面,增加下游活动类的预训练数据量可持续改善泛化性能,而增加更多标注数据仅带来有限提升。有趣的是,纳入非下游活动类的无标签数据并未提升泛化能力。(3)来自定制等级设备的传感器数据比来自科研等级设备的数据更具泛化性, limb 位置收集的数据能更有效地迁移到躯干位置。BenchHAR提供了统一的基准框架和可操作的洞见,为通用传感器-based HAR系统提供支持。我们的代码已公开于 https://github.com/saiketa/HAR-Bench。

关键词

引用

@article{arxiv.2605.08296,
  title  = {BenchHAR: Benchmarking Self-Supervised Learning for Generalizable Sensor-based Activity Recognition},
  author = {Yize Cai and Rui Feng and Anlan Yu and Baoshen Guo and Zhiqing Hong},
  journal= {arXiv preprint arXiv:2605.08296},
  year   = {2026}
}

备注

25 pages