基于度量学习的多模态元学习:通过脚步识别进行人体运动辨识
声音
2021-11-16 v1 人工智能
机器学习
系统与控制
音频与语音处理
系统与控制
神经元与认知
摘要
我们描述了一种新颖的基于度量学习的方法,其引入多模态框架并使用暹罗配置下的深度音频与地听器编码器来设计一个可适应且轻量级的监督模型。该框架消除了昂贵的数据标注过程之需,并从无处不在的传感系统所获得的低多传感数据中学习通用表征。这些传感系统在活动识别任务中提供了众多应用与各种用例。在此,我们旨在探索室内环境下的人体脚步运动,并分析来自小型自采集的声学与基于振动的传感器数据集的表征。核心思想在于学习两种感官特征之间的合理相似性,并融合来自音频与地听器信号的表征。我们提出一个通用框架,以从音频与地听器信号提取的时空特征中学习嵌入。随后我们在共享空间中提取表征,以最大化声学与地听器特征间兼容性函数的学习。这进而可被有效用于从所学模型执行分类任务,正如我们对含人体脚步运动的样本对赋予高相似性、对不含脚步运动的样本对赋予较低相似性所展示的那样。性能分析表明,当训练样本从 200 对仅增至 500 对时,我们提出的多模态框架取得了 19.99%(绝对项)的准确率提升,并在评估集上避免了过拟合,同时令人满意地学习到音频与地听器表征。我们的结果采用基于度量的对比学习方法处理多传感器数据,以减轻数据稀缺的影响,并以有限数据规模执行人体运动辨识。
引用
@article{arxiv.2111.07979,
title = {Metric-based multimodal meta-learning for human movement identification via footstep recognition},
author = {Muhammad Shakeel and Katsutoshi Itoyama and Kenji Nishida and Kazuhiro Nakadai},
journal= {arXiv preprint arXiv:2111.07979},
year = {2021}
}