面向资源受限机器人的混合 ASR:HMM 与深度学习融合
音频与语音处理
2024-12-25 v1 人工智能
声音
摘要
本文提出了一种专为资源受限机器人设计的新型混合自动语音识别(ASR)系统。所提方法将隐马尔可夫模型(HMMs)与深度学习模型相结合,并利用套接字编程来有效分配处理任务。在该架构中,基于 HMM 的处理在机器人内部进行,而单独的 PC 负责处理深度学习模型。HMMs 与深度学习之间的这种协同作用显著提升了语音识别准确率。我们在多种机器人平台上进行了实验,展示了实时且精确的语音识别能力。值得注意的是,该系统对变化的声学条件具有适应性,并与低功耗硬件兼容,使其在计算资源有限的环境中非常高效。这种混合 ASR 范式为人机无缝交互开辟了广阔前景。总之,我们的研究为面向机器人的 ASR 技术引入了一个开创性维度。通过采用套接字编程跨不同设备分配处理任务,并策略性地将 HMMs 与深度学习模型结合,我们的混合 ASR 系统展示了其使机器人能够熟练理解并响应口语的潜力,即使在计算资源受限的环境中也是如此。该范式为在广泛的实际场景中增强人机交互指明了创新路径。
引用
@article{arxiv.2309.07164,
title = {Hybrid ASR for Resource-Constrained Robots: HMM - Deep Learning Fusion},
author = {Anshul Ranjan and Kaushik Jegadeesan},
journal= {arXiv preprint arXiv:2309.07164},
year = {2024}
}
备注
To be published in IEEE Access, 9 pages, 14 figures, Received valuable support from CCBD PESU, for associated code, see https://github.com/AnshulRanjan2004/PyHMM