中文

人机交互中的单通道机器人自我语音过滤

机器人学 2024-03-06 v1 人机交互 声音 音频与语音处理

摘要

本文研究当人类语音与社交机器人Pepper的语音和风扇噪声重叠时,如何自动过滤人类语音。我们最终的目标是实现一种人机交互场景,即当机器人说话时麦克风保持开启,从而实现更自然的轮流发言模式,允许人类打断机器人。为了做出适当响应,机器人需要理解对话者在重叠部分所说的话,这可以通过目标语音提取(TSE)实现。为了探究在流行社交机器人Pepper的背景下TSE的效果,我们制作了一个数据集,包含Pepper自身录制语音、其风扇噪声(靠近麦克风)以及人类语音的混合,这些语音由Pepper麦克风在低混响和高混响房间中录制。比较了有无后滤波的信号处理方法、卷积循环神经网络(CRNN)方法以及基于说话人识别的先进TSE模型,我们发现无后滤波的信号处理方法在低混响重叠语音信号上取得了最佳词错误率,而CRNN方法对混响更鲁棒。这些结果表明,在现实应用中,只要房间混响低且人类语音音量高或音调高,从与机器人重叠的语音中估计人类语音是可行的。

关键词

引用

@article{arxiv.2403.02918,
  title  = {Single-Channel Robot Ego-Speech Filtering during Human-Robot Interaction},
  author = {Yue Li and Koen V Hindriks and Florian Kunneman},
  journal= {arXiv preprint arXiv:2403.02918},
  year   = {2024}
}

备注

Accepted by ACM Technological Advances in Human-Robot Interaction. 9 pages