Semi-FedSER:基于多视图伪标注的联邦学习半监督语音情感识别
音频与语音处理
2023-04-18 v1 密码学与安全
机器学习
声音
摘要
语音情感识别(SER)应用常伴随隐私问题,因为它通常在客户端获取并传输语音数据至远程云平台以作进一步处理。这些语音数据不仅可揭示语音内容与情感信息,还可暴露说话人身份、人口统计学特征及健康状况。联邦学习(FL)是一种分布式机器学习算法,它协调各客户端协作训练模型而无需共享本地数据。该算法在 SER 应用中展现出巨大潜力,因为从用户设备共享原始语音或语音特征易受隐私攻击。然而,FL 的一大挑战是高质量标注数据样本有限。本工作中,我们提出一种半监督联邦学习框架 Semi-FedSER,利用有标注与无标注数据样本以应对 FL 中标注数据样本有限的挑战。我们表明,即便在本地标注率 l=20 时,使用两个 SER 基准数据集 IEMOCAP 与 MSP-Improv,我们的 Semi-FedSER 仍能生成理想的 SER 性能。
引用
@article{arxiv.2203.08810,
title = {Semi-FedSER: Semi-supervised Learning for Speech Emotion Recognition On Federated Learning using Multiview Pseudo-Labeling},
author = {Tiantian Feng and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2203.08810},
year = {2023}
}
备注
This paper was submitted to Insterspeech 2022 for review