中文

基于视觉姿态滤波与可穿戴加速度的拥挤场景中无音频说话状态检测

计算机视觉与模式识别 2022-11-02 v1 机器学习 声音 音频与语音处理

摘要

在拥挤场景中识别谁在说话是理解其中进行的社会交互的一项关键挑战。仅从身体运动检测说话状态为分析无法获取个人音频的社会场景打开了大门。视频与可穿戴传感器使得以不引人注意、保护隐私的方式识别说话成为可能。在考虑视频模态时,动作识别问题中传统上使用边界框来定位并分割出目标对象,进而识别其中发生的动作。然而,交叉污染、遮挡以及人体的关节化特性使得该方法在拥挤场景中颇具挑战。在此,我们利用关节化身体姿态进行对象定位及后续的语音检测阶段。我们表明,在姿态关键点周围选取局部特征对泛化性能有正向作用,同时也显著减少了所考虑的局部特征数量,从而构成一种更高效的方法。利用具有不同对象视角的两个真实场景数据集,我们探究了交叉污染在该效应中的作用。此外,我们借助通过可穿戴传感器测得的加速度用于同一任务,并提出了一种结合两种方法的多模态方法。

关键词

引用

@article{arxiv.2211.00549,
  title  = {No-audio speaking status detection in crowded settings via visual pose-based filtering and wearable acceleration},
  author = {Jose Vargas-Quiros and Laura Cabrera-Quiros and Hayley Hung},
  journal= {arXiv preprint arXiv:2211.00549},
  year   = {2022}
}