SpatialEmb:用于任意麦克风阵列的1阶段多通道多说人语音识别中的空间信息提取与编码
介观与纳米尺度物理
2026-01-27 v1
摘要
空间信息是多通道多说人目标语音识别中的关键线索。大多数当前最先进的多通道自动语音识别(ASR)系统仅在语音分离阶段提取空间特征,然后在分离后的语音上执行标准单通道ASR。这会导致效率低下、流程冗长,并且由于预处理模块积累的误差,导致亚最优的ASR性能。此外,大多数空间特征提取方法依赖说话人位置和麦克风拓扑知识,使系统依赖于特定设置,难以适应新设备。本文提出一种解决方案,通过一个轻量级嵌入模块SpatialEmb,直接为ASR模型提取并编码空间信息,支持固定和任意麦克风拓扑。我们在阿里会议语料库(AliMeeting)上进行了全面实验,以确定SpatialEmb的最优模型设计,兼顾性能和效率。我们最佳模型在105小时的Train-Ali-far训练数据下,分别在Eval和Test集合上实现了17.04%和20.32%的字符错误率(CER),以相同训练数据建立了新的状态最佳结果。
关键词
引用
@article{arxiv.2601.18036,
title = {Hybridization of topologically distinct quartet modes in three-terminal graphene Josephson junctions},
author = {Asmaul Smitha Rashid and Le Yi and Takashi Taniguchi and Kenji Watanabe and Nitin Samarth and Régis Mélin and Morteza Kayyalha},
journal= {arXiv preprint arXiv:2601.18036},
year = {2026}
}