基于音频语言模型中的 token 级投机解码的边云协同语音情感标注
声音
2026-03-13 v1
摘要
语音情感标注(SEC) 利用大型音频语言模型生成来自语音的丰富、情境感知的情感描述。然而,实际部署面临资源受限边缘设备的高计算需求和传输生物识别音频的隐私风险。虽然较小的音频语言模型可实现高效的本地 SEC,但其有限的容量往往削弱细微的 paralinguistic 建模和精细的情感 grounding。我们提出一种基于不确定性引导的投机解码(UGSD)的边云协同框架。轻量级边缘模型在本地草拟标注,仅对高不确定性 token 块选择性地升级到更强大的云端验证器进行验证。MER2024 基准上的实验表明,UGSD 实现了最高可达 62.7% 的 BLEU 改进。UGSD 还比仅使用的边缘模型实现了 1.4 倍的延迟降低和 8.5 倍的 token 吞吐量提升。这些结果实证表明了可部署 SEC 系统在质量、效率和隐私之间的权衡。
引用
@article{arxiv.2603.11397,
title = {Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models},
author = {Xiangyuan Xue and Jiajun Lu and Yan Gao and Gongping Huang and Ting Dang and Hong Jia},
journal= {arXiv preprint arXiv:2603.11397},
year = {2026}
}