利用双耳特征和局部线性回归实现图像中声源的协同定位
声音
2016-04-18 v4 多媒体
应用统计
机器学习
摘要
本文探讨了利用双耳测量进行声源定位的问题。我们提出了一种监督式公式,可同时定位不同位置的多个声源。该方法本质上具有高效性,因为与先前工作相反,它既不依赖声源分离,也不依赖单耳分离。该方法始于一个训练阶段,建立所有声源的方向坐标与从双耳测量中提取的听觉特征之间的局部线性高斯回归模型。虽然使用固定长度的宽谱声音(白噪声)进行训练以可靠地估计模型参数,但我们表明测试(定位)可以扩展到可变长度的稀疏谱声音(如语音),从而实现广泛的实际应用。事实上,我们证明了该方法可用于视听融合,即将语音信号映射到图像上,从而在空间上对齐音频和视觉模态,进而能够区分说话和非说话的人脸。我们发布了一个新颖的真实房间录音语料库,允许在存在一个或两个声源的情况下对协同定位方法进行定量评估。实验表明,相对于几种最先进的方法,该方法在准确性和速度上均有提升。
引用
@article{arxiv.1408.2700,
title = {Co-Localization of Audio Sources in Images Using Binaural Features and Locally-Linear Regression},
author = {Antoine Deleforge and Radu Horaud and Yoav Schechner and Laurent Girin},
journal= {arXiv preprint arXiv:1408.2700},
year = {2016}
}
备注
15 pages, 8 figures