基于ASR和大型语言模型的语音到动作系统自适应边云推理
声音
2025-12-19 v2 人工智能
摘要
语音交互已成为控制物联网设备的自然且直观的模式。然而,语音驱动的边缘设备面临着在云端解决方案和边缘解决方案之间的根本性权衡:后者在语言理解能力方面更强,但代价是延迟、连接依赖性和隐私 concerns;前者提供低延迟和改进的隐私,但受计算约束限制。本文提出了ASTA—a种自适应语音到动作解决方案,动态在边缘和云端推理之间路由语音命令,以平衡性能和系统资源利用。ASTA集成了基于ASR和轻量级离线语言模型推理的设备端推理,以及基于LLM的云端处理,依据实时系统指标(如CPU工作负载、设备温度和网络延迟)进行指导。度量感知路由机制在运行时选择推理路径,而基于规则的命令验证和修复组件确保成功的端到端命令执行。我们在基于NVIDIA Jetson的边缘平台上实现了该解决方案,并使用包含80个口语命令的多样化数据集进行评估。实验结果表明,ASTA成功地为所有输入命令路由执行,实现了在线和离线推理之间的平衡分布。系统实现了62.5%的ASR准确率,并且仅针对47.5%的输入生成可执行命令,凸显了修复机制在提高鲁棒性方面的重要性。这些结果表明,自适应边云编排是面向韧性和资源感知的语音控制物联网系统的可行方法。
引用
@article{arxiv.2512.12769,
title = {Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models},
author = {Mohammad Jalili Torkamani and Israt Zarin},
journal= {arXiv preprint arXiv:2512.12769},
year = {2025}
}
备注
preprint, 6 pages, 7 figures, 1 table