中文

一种用于人类-机器人交互中语音中断的近实时处理自我语音滤波管线

仪器与探测器 2025-01-07 v2 天体物理仪器与方法 广义相对论与量子宇宙学

摘要

当前最先进的自动语音识别 (ASR) 系统无法独立转录重叠的语音音频流。因此,当这些 ASR 系统用于社交机器人如 Pepper 与人类进行交互时,常见的做法是在机器人自身发言时关闭其麦克风。这限制了基于语音的人类-机器人交互。为实现更自然的交互方式,本文提出一种仅使用单通道麦克风的机器人自我语音滤波音频处理管线。该管线利用将机器人自我语音信号(由文本转语音 API 生成)作为训练数据输入到机器学习模型中的可能性。提议的管线结合了卷积神经网络和谱减法,用于从由机器人嵌入式麦克风录制的音频中提取重叠的人类语音。在评估 held-out 测试集时,我们发现该管线超越了我们之前的该任务方法,以及使用相同数据集重新训练的多项最先进目标语音提取系统。我们还将该管线集成到轻量级机器人软件开发框架中,以便更广泛地使用。作为演示该管线可行性的一步,我们使用该框架在基于 Pepper 的小型实验室可行性试点中评估了该管线的效果。我们的结果表明,当参与者中断机器人时,该管线能够从机器人嵌入式单通道麦克风接收的单秒流式音频缓冲区中提取出参与者的语音,从而实现近实时处理。

关键词

引用

@article{arxiv.2405.13475,
  title  = {Sensitivity and control of a 6-axis fused-silica seismometer},
  author = {Jiri Smetana and Amit Singh Ubhi and Emilia Chick and Leonid Prokhorov and John Bryant and Artemiy Dmitriev and Alex Gill and Lari Koponen and Haixing Miao and Alan V. Cumming and Giles Hammond and Valery Frolov and Richard Mittleman and Peter Fritchel and Denis Martynov},
  journal= {arXiv preprint arXiv:2405.13475},
  year   = {2025}
}

备注

12 pages, 3 figures