面向自动语音识别的统一可学习二维卷积特征提取
音频与语音处理
2025-09-15 v1 计算与语言
机器学习
声音
摘要
神经前端为自动语音识别(ASR)系统的特征提取提供了一种有前景的方法,因为它们能够学习针对不同任务量身定制的特定特征。然而,许多现有技术仍深受经典方法的影响。虽然这种归纳偏置可能简化系统设计,但我们的工作旨在开发一种更通用的特征提取前端。此外,我们寻求统一前端架构,这与现有方法中应用源自不同来源的多种层拓扑组合形成对比。实验系统地展示了如何减少现有技术的影响以实现通用前端。由此产生的二维卷积前端参数效率高,且适用于计算资源有限的场景,这与在无标签音频上预训练的大型模型不同。结果表明,这种通用的统一方法不仅可行,而且其性能可与现有的有监督可学习特征提取器相媲美。
引用
@article{arxiv.2509.10031,
title = {Unified Learnable 2D Convolutional Feature Extraction for ASR},
author = {Peter Vieting and Benedikt Hilmes and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2509.10031},
year = {2025}
}
备注
Accepted at ITG Conference on Speech Communication 2025