中文

Kite:面向无人机的自动语音识别系统

声音 2019-07-03 v1 计算机视觉与模式识别 音频与语音处理

摘要

本文研究构建适配无人机(UAVs)控制的语音识别系统的问题。尽管无人机日益普及,为其创建语音界面的任务在很大程度上尚未得到解决。为此,我们引入了一个用于无人机控制的多模态评估数据集,其由口语指令及关联图像组成,图像代表了飞行员发出指令时无人机“看到”的视觉上下文。我们给出了基线结果并探讨两个研究方向:(i)在训练时指令列表不完整的情况下语言模型的鲁棒性如何;(ii)如何将视觉信息融入语言模型。我们发现循环神经网络(RNNs)是这两项任务的解决方案:它们可利用少量指令成功适配,并可扩展以利用视觉线索。我们的结果表明,即便指令-图像训练关联是自动生成且天然不完美的,基于图像的RNN仍优于仅基于文本的对应模型。数据集与代码可在http://kite.speed.pub.ro获取。

关键词

引用

@article{arxiv.1907.01195,
  title  = {Kite: Automatic speech recognition for unmanned aerial vehicles},
  author = {Dan Oneata and Horia Cucu},
  journal= {arXiv preprint arXiv:1907.01195},
  year   = {2019}
}

备注

5 pages, accepted at Interspeech 2019