中文

用于到达方向估计的静态视觉空间先验

声音 2019-04-02 v1 音频与语音处理

摘要

当我们与世界交互时,例如在大开放空间或会议室中与同事交流,我们会持续分析周围环境,特别是定位并识别声学事件。尽管我们很大程度上认为此类能力理所当然,但它们对当前机器人或智能语音助手而言代表了一个具有挑战性的问题,因为它们很容易被声学复杂环境中的高度声音干扰所欺骗。仅使用音频数据防止此类失败是困难的,甚至不可能,因为算法需要考虑更宽泛的上下文并经常在语义层面理解场景。本文中,我们提出了据我们所知首个多模态声音到达方向(DoA)方法,其利用静态视觉空间先验提供关于环境的辅助信息以抑制部分错误的 DoA 检测。我们在一个新收集的的真实世界数据集上验证了我们的方法,并表明我们的方法持续优于经典 DoA 基线。

关键词

引用

@article{arxiv.1904.00202,
  title  = {Static Visual Spatial Priors for DoA Estimation},
  author = {Pawel Swietojanski and Ondrej Miksik},
  journal= {arXiv preprint arXiv:1904.00202},
  year   = {2019}
}

备注

6 pages, 6 figures, 3 tables