联邦学习场景下语音情感识别的属性推断攻击
密码学与安全
2022-12-26 v3 机器学习
多媒体
摘要
语音情感识别(SER)处理语音信号以检测并刻画所表达的可感知情绪。许多 SER 应用系统通常在客户端采集语音数据并将其传输至远程云平台进行推理与决策。然而,语音数据不仅携带声学表达中所传达的情绪信息,还包含其他敏感人口统计特征,如性别、年龄与语言背景。因此,SER 系统最好能够在分类情绪构念的同时,防止对敏感及人口统计信息的非预期或不恰当推断。联邦学习(FL)是一种分布式机器学习范式,它协调各客户端协作训练模型而无需共享其本地数据。这种训练方式看似安全,并能提升 SER 的隐私性。然而,近期工作表明 FL 方法仍易受多种隐私攻击,如重构攻击与成员推断攻击。尽管其中大多数聚焦于计算机视觉应用,但此类信息泄露同样存在于采用 FL 技术训练的 SER 系统中。为评估经 FL 训练的 SER 系统的信息泄露情况,我们提出一种属性推断攻击框架,分别从共享梯度或模型参数中推断客户端的敏感属性信息,分别对应 FedSGD 与 FedAvg 训练算法。作为一个用例,我们使用三个 SER 基准数据集 IEMOCAP、CREMA-D 与 MSP-Improv,实证评估了该方法预测客户端性别信息的能力。我们表明,针对采用 FL 训练的 SER 系统,属性推断攻击是可实现的。我们进一步发现,大多数信息泄露可能源自 SER 模型的第一层。
引用
@article{arxiv.2112.13416,
title = {Attribute Inference Attack of Speech Emotion Recognition in Federated Learning Settings},
author = {Tiantian Feng and Hanieh Hashemi and Rajat Hebbar and Murali Annavaram and Shrikanth S. Narayanan},
journal= {arXiv preprint arXiv:2112.13416},
year = {2022}
}