超越混淆:对人类活动识别基准数据集的细粒度对话式检视
机器学习
2024-12-13 v1
摘要
机器学习 (ML) 算法用于人类活动识别 (HAR) 的研究已取得显著进展,并借助公开数据集。然而,大多数研究优先考虑统计指标,而不考察负样本细节。虽然最近应用于 HAR 数据集的 Transformer 模型在基准指标上取得有限成功,但其它方法在相似水平上取得了近 100% 的准确率。这引发了对当前方法局限性的质疑。本文旨在通过对六大热门 HAR 基准数据集进行细粒度检视来解决这些开放问题。我们识别出某些数据部分中,六种选定的 SOTA ML 方法均无法正确分类,称为误分类交集 (IFC)。对 IFC 的分析揭示了若干根本性问题,包括模糊的注释、记录执行中的不规则情况以及过渡期间的错位。我们为该领域做出的贡献在于量化和刻画注释数据中的歧义,提供用于数据修补的三分类掩码,并强调未来数据收集的潜在改进。
引用
@article{arxiv.2412.09037,
title = {Beyond Confusion: A Fine-grained Dialectical Examination of Human Activity Recognition Benchmark Datasets},
author = {Daniel Geissler and Dominique Nshimyimana and Vitor Fortes Rey and Sungho Suh and Bo Zhou and Paul Lukowicz},
journal= {arXiv preprint arXiv:2412.09037},
year = {2024}
}