中文

基于核的传感器融合及其在音视频语音活动检测中的应用

计算机视觉与模式识别 2016-11-23 v1

摘要

本文中,我们解决在噪声和干扰下多视图数据融合问题。近期研究使用核方法处理该问题,特别依赖于为每个视图分别构造的核的乘积。从图论视角,我们在离散设定下分析此融合方法。更具体地,基于数据点间连通性的统计模型,我们提出一种核带宽选择算法,该参数正如我们所展示的,对此融合方法对干扰的鲁棒性有重要影响。然后,我们考虑由指向说话人脸部的单个麦克风和摄像机测量的音视频语音信号的融合。具体地,我们解决语音活动检测任务,即在不规则干扰(如键盘敲击和办公室噪声)存在下检测语音和非语音段。我们提出一种基于音视频信号的语音活动检测算法。仿真结果表明所提算法优于竞争的融合和语音活动检测方法。此外,我们证明恰当选择核带宽确实带来性能提升。

关键词

引用

@article{arxiv.1604.02946,
  title  = {Kernel-based Sensor Fusion with Application to Audio-Visual Voice Activity Detection},
  author = {David Dov and Ronen Talmon and Israel Cohen},
  journal= {arXiv preprint arXiv:1604.02946},
  year   = {2016}
}