中文

SGGNet$^2$:用于语音引导导航的语音-场景图定位网络

机器人学 2024-04-16 v2

摘要

口语作为一种便捷高效的接口,使非专业用户和残障用户能够与复杂的辅助机器人交互。然而,由于说话人声音中的声学变异与环境噪声,准确接地(grounding)语言表述是一项重大挑战。在本工作中,我们提出一种新颖的语音-场景图定位网络(SGGNet2^2),其通过利用自动语音识别(ASR)系统正确识别与误识别词之间的声学相似性,稳健地对接口语表述。为引入声学相似性,我们将先前的定位模型——基于场景图的定位网络(SGGNet)——与来自 NVIDIA NeMo 的 ASR 模型相结合。具体做法是将语音发音的潜向量输入 SGGNet 中基于 BERT 的定位网络。我们通过定性与定量研究评估了在定位中使用语音命令潜向量的有效性。我们还使用 Rainbow Robotics 的真实四足机器人 RBQ-3 展示了 SGGNet2^2 在基于语音的导航任务中的能力。

关键词

引用

@article{arxiv.2307.07468,
  title  = {SGGNet$^2$: Speech-Scene Graph Grounding Network for Speech-guided Navigation},
  author = {Dohyun Kim and Yeseung Kim and Jaehwi Jang and Minjae Song and Woojin Choi and Daehyung Park},
  journal= {arXiv preprint arXiv:2307.07468},
  year   = {2024}
}

备注

7 pages, 6 figures, Published at 2023 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), [Dohyun Kim, Yeseung Kim, Jaehwi Jang, and Minjae Song] contributed equally to this work