基于视觉跟踪引导的加权延迟求和波束成形用于人机交互
音频与语音处理
2019-06-19 v1 声音
图像与视频处理
摘要
本文描述了将加权延迟求和波束成形与利用图像处理和机器人头部视觉伺服的语音源定位相集成以实现源跟踪。我们考虑到波束成形提供的指向性增益取决于其主瓣与麦克风阵列主响应轴之间的角距离。视觉伺服方案用于减小机器人相机视频帧中心与目标物体之间的角距离。此外,所提出的波束成形策略结合了两种信息源:通过图像处理获得的目标物体方向以及由麦克风阵列提供的音频信号。这些信源通过采用加权延迟求和波束成形方法进行了集成。实验在由 PR2 机器人构建的真实移动机器人测试平台上开展。考虑了机器人头部的静态与动态情况,以及使用一和两个外部噪声源的情形。本文给出的结果表明,将视觉源跟踪与视觉伺服及波束成形方法适当集成,相比单独使用波束成形可使词错误率(WER)降低高达 34%。
引用
@article{arxiv.1906.07298,
title = {Weighted delay-and-sum beamforming guided by visual tracking for human-robot interaction},
author = {José Novoa and Rodrigo Mahu and Alejandro Díaz and Jorge Wuth and Richard Stern and Nestor Becerra Yoma},
journal= {arXiv preprint arXiv:1906.07298},
year = {2019}
}