中文

面向噪声环境中哈迈语音分离与增强的神经网络架构优化

声音 2025-08-25 v1 机器学习

摘要

本文针对哈迈语音分离与增强面临的挑战,特别关注边缘设备,提出了一种先进的神经网络架构方法。我们采用 DEMUCS 模型,以克服传统方法的局限性,显著提升语音清晰度和可理解性。该模型通过引入 U-Net 和 LSTM 层进行微调,训练数据来自 40 万段哈迈语音剪辑,同时引入 ESC-50 和 MS-SNSD 以应对多样化的声学环境。使用 PESQ 和 STOI 指标进行评估,结果在极端噪声条件下表现尤为突出。为确保在如 TWS 耳机等资源受限的设备上部署,我们探索了量化技术以降低计算需求。该研究凸显了针对印度语境优化的定制 AI 算法在语音处理中的有效性,并为优化基于边缘的架构提供了未来方向。

关键词

引用

@article{arxiv.2508.12009,
  title  = {Optimizing Neural Architectures for Hindi Speech Separation and Enhancement in Noisy Environments},
  author = {Arnav Ramamoorthy},
  journal= {arXiv preprint arXiv:2508.12009},
  year   = {2025}
}

备注

ICAD 2025