中文

SelfHAR:利用未标记数据通过自训练改进人类活动识别

机器学习 2021-02-12 v1

摘要

机器学习和深度学习在包括人类活动识别在内的移动感知应用中展现出巨大前景。然而,此类模型在真实世界环境中的性能很大程度上取决于能否获得捕捉多样行为的大型数据集。近来,计算机视觉和自然语言处理中的研究表明,利用海量未标记数据可达到与最先进监督模型相当的性能。在本工作中,我们提出SelfHAR,一种半监督模型,能有效学习利用未标记移动感知数据集来补充小型标记数据集。我们的方法结合了教师-学生自训练(在允许数据增强的同时提炼未标记与标记数据集的知识)和多任务自监督(通过预测输入的失真版本来学习鲁棒的信号级表示)。我们在多个HAR数据集上评估了SelfHAR,并展现出优于监督和既往半监督方法的state-of-the-art性能,在使用相同数量推理模型参数下F1分数提升高达12%。此外,SelfHAR具有数据高效性,与使用监督方法相比,利用最多少10倍的标记数据即可达到相似性能。我们的工作不仅在多样化HAR数据集上实现了state-of-the-art性能,也阐明了预训练任务如何影响下游性能。

关键词

引用

@article{arxiv.2102.06073,
  title  = {SelfHAR: Improving Human Activity Recognition through Self-training with Unlabeled Data},
  author = {Chi Ian Tang and Ignacio Perez-Pozuelo and Dimitris Spathis and Soren Brage and Nick Wareham and Cecilia Mascolo},
  journal= {arXiv preprint arXiv:2102.06073},
  year   = {2021}
}

备注

Accepted for publication in Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies (IMWUT) 2021