中文

面向智能眼镜的多通道差分语音识别

音频与语音处理 2025-09-19 v1 声音

摘要

随着智能眼镜等可穿戴设备用于 AI 助手的日益普及,佩戴者语音识别(WSR)正变得越来越关键,以适应下一代人机界面。然而,在实际环境中,侧声干扰仍然是 WSR 的重要挑战,可能导致下游任务(如自然语言处理)的累积性错误。本文引入一种 novel 多通道差分自动语音识别(ASR)方法,用于智能眼镜的稳健 WSR。proposed 系统采用来自不同前端的差分输入,这些前端互为补充,提高了 WSR 的鲁棒性,包括波束成形器、麦克风选择和轻量级侧声检测模型。在仿真数据集和真实数据集上的评估表明,所提系统优于传统方法,在词错误率上实现了最高 18.0% 的相对降低。

关键词

引用

@article{arxiv.2509.14430,
  title  = {Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses},
  author = {Yufeng Yang and Yiteng Huang and Yong Xu and Li Wan and Suwon Shon and Yang Liu and Yifeng Fan and Zhaojun Yang and Olivier Siohan and Yue Liu and Ming Sun and Florian Metze},
  journal= {arXiv preprint arXiv:2509.14430},
  year   = {2025}
}