基于边缘计算的 Kinyarwanda 与 Swahili 语言语音转文字与合成
分布式、并行与集群计算
2025-10-21 v1 机器学习
摘要
本文提出一种新型框架,用于语音转文字与文字转语音,利用边缘云并行处理以提升 Kinyarwanda 与 Swahili 语言用户的处理速度与可达性。该框架针对东非地区技术基础有限、缺乏强大语言处理工具的实际需求进行设计。框架采用 Whisper 与 SpeechT5 预训练模型实现语音识别(STT)与语音合成(TTS)。该架构采用级联机制在边缘设备与云端之间分配模型推理负载,从而降低延迟与资源消耗,惠及双方。在边缘设备上,本方法对 SpeechT5 模型实现 9.5% 的内存压缩,对 Whisper 模型实现 14% 的内存压缩,最大内存占用仅 149 MB。实验结果表明,在 1.7 GHz CPU 边缘设备和 1 MB/s 网络带宽条件下,系统可在不足一分钟内完成对 270 字符文本的语音转文字与文字转语音双向转换。基于肯尼亚实地调查数据,表明所提出的级联边缘-云架构可轻松作为 STT 与 TTS 转换的优异平台,实现良好的准确率与响应速度。
引用
@article{arxiv.2510.16497,
title = {Edge-Based Speech Transcription and Synthesis for Kinyarwanda and Swahili Languages},
author = {Pacome Simon Mbonimpa and Diane Tuyizere and Azizuddin Ahmed Biyabani and Ozan K. Tonguz},
journal= {arXiv preprint arXiv:2510.16497},
year = {2025}
}