中文

面向人机交互中语音打断的近实时处理自我语音过滤流水线

人机交互 2024-05-24 v1 声音 音频与语音处理

摘要

使用当前最先进的自动语音识别 (ASR) 系统,无法将重叠的语音音频流分别转录。因此,当这些 ASR 系统作为 Pepper 等社交机器人的一部分用于与人类交互时,通常的做法是在机器人自己说话时关闭其麦克风。这阻止了人类用户打断机器人,从而限制了基于语音的人机交互。为了实现允许此类打断的更自然交互,我们提出了一种仅使用单通道麦克风过滤机器人自我语音的音频处理流水线。该流水线利用了将由文本转语音 API 生成的机器人自我语音信号作为训练数据输入机器学习模型的可能性。所提出的流水线结合了卷积神经网络和谱减法,以从机器人嵌入式麦克风录制的音频中提取重叠的人类语音。在留出测试集上进行评估时,我们发现该流水线优于我们以前处理该任务的方法,以及在同一数据集上重新训练的最先进的目标语音提取系统。我们还将所提出的流水线集成到一个轻量级机器人软件开发框架中,以供更广泛的使用。作为展示部署我们流水线可行性的一步,我们使用该框架在社交机器人 Pepper 上进行的小型实验室可行性试点中评估了流水线的有效性。结果表明,当参与者打断机器人时,该流水线可以从机器人嵌入式单通道麦克风接收到的一秒流式音频缓冲区中提取参与者的语音,从而实现近实时处理。

关键词

引用

@article{arxiv.2405.13477,
  title  = {A Near-Real-Time Processing Ego Speech Filtering Pipeline Designed for Speech Interruption During Human-Robot Interaction},
  author = {Yue Li and Florian A. Kunneman and Koen V. Hindriks},
  journal= {arXiv preprint arXiv:2405.13477},
  year   = {2024}
}

备注

8 pages,16 figures, Under review by RoMan 2024 conference