中文

面向智能眼镜鲁棒语音识别的定向源分离

声音 2025-06-17 v2 人机交互 音频与语音处理

摘要

现代智能眼镜利用先进的音频感知与机器学习技术,提供实时转写与字幕服务,极大丰富了日常交流中的人类体验。然而,此类系统常面临与环境噪声相关的挑战,导致语音识别与说话人变换检测性能下降。为改善语音质量,本文研究利用多麦克风阵列的定向源分离。我们首先探索多种波束成形器,通过增强语音信号的方向特性来辅助源分离建模。除依赖预设波束成形器外,我们还研究了多通道源分离中的神经波束成形,表明自动学习方向特性可有效提升分离质量。我们进一步比较了利用分离输出与含噪输入时的 ASR 性能。结果表明,定向源分离有益于佩戴者的 ASR,但对对话伙伴无益。最后,我们对定向源分离与 ASR 模型进行联合训练,取得了最佳的整体 ASR 性能。

关键词

引用

@article{arxiv.2309.10993,
  title  = {Directional Source Separation for Robust Speech Recognition on Smart Glasses},
  author = {Tiantian Feng and Ju Lin and Yiteng Huang and Weipeng He and Kaustubh Kalgaonkar and Niko Moritz and Li Wan and Xin Lei and Ming Sun and Frank Seide},
  journal= {arXiv preprint arXiv:2309.10993},
  year   = {2025}
}

备注

Published in ICASSP 2025, Hyderabad, India, 2025