面向边缘云端的带宽高效隐私保护多对多语音翻译
人工智能
2026-05-28 v1
摘要
多模态大语言模型(MLLMs)在语音到文本翻译(S2TT)方面展现出巨大潜力。然而,现有部署范式面临两个关键挑战:纯本地模型因资源受限而受限,而集中式云端系统通过传输原始语音数据则面临严重隐私风险和带宽瓶颈。此外,大多数模型都呈现出以英语为中心的偏见,限制了多对多翻译的规模化。在本文中,我们提出了边缘云端语音识别与翻译(ESRT)框架,这是一个隐私保护且带宽高效的协作式边缘云端 MLLM 方案。具体而言,我们设计了一种边缘云端分割推理架构,在设备端保留轻量级语音编码器和适配器,仅传输高度压缩的中间特征。这从根本上防止了语音特征泄露,并将带宽需求降低最高可达 10 倍。为克服以英语为中心的瓶颈,我们引入了多任务加权课程学习策略,配合数据平衡以确保跨语言一致性。在 FLEURS 数据集上进行大量实验表明,我们的模型 ESRT-4B 和 ESRT-12B 在 45 种语言(共 45×44 方向)上实现了 Surpassing 现有的多对多 S2TT 性能。我们发布代码和模型以促进可重复的、隐私意识型的 MLLM S2TT 研究。代码和模型已发布于 https://github.com/yxduir/esrt。
引用
@article{arxiv.2605.28642,
title = {Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation},
author = {Yexing Du and Kaiyuan Liu and Youcheng Pan and Bo Yang and Ming Liu and Bing Qin and Yang Xiang},
journal= {arXiv preprint arXiv:2605.28642},
year = {2026}
}