中文

HyDiscGAN: 用于多模态情感分析中音频-视觉隐私保护的混合分布式cGAN

多媒体 2024-04-19 v1 分布式、并行与集群计算 声音 音频与语音处理

摘要

多模态情感分析(MSA)旨在识别多模态视频内容中说话者的情感倾向,这引发了与多模态数据(如声纹和面部图像)相关的隐私风险的严重担忧。最近的分布式协作学习已被验证为多模态任务中隐私保护的有效范式。然而,它们常常忽略不同模态之间的隐私差异,难以在性能和隐私保护之间取得平衡。因此,这提出了一个有趣的问题:如何最大化多模态利用以提高性能,同时保护必要的模态。本文首次尝试在MSA任务中进行模态指定(即音频和视觉)的隐私保护。我们提出了一种新颖的混合分布式跨模态cGAN框架(HyDiscGAN),该框架学习多模态对齐,以生成以可共享的去标识化文本数据为条件的虚假音频和视觉特征。目标是利用虚假特征逼近真实的音频和视觉内容,以保证隐私保护,同时有效提升性能。大量实验表明,与最先进的MSA模型相比,HyDiscGAN在保护隐私的同时可以实现优越或具有竞争力的性能。

关键词

引用

@article{arxiv.2404.11938,
  title  = {HyDiscGAN: A Hybrid Distributed cGAN for Audio-Visual Privacy Preservation in Multimodal Sentiment Analysis},
  author = {Zhuojia Wu and Qi Zhang and Duoqian Miao and Kun Yi and Wei Fan and Liang Hu},
  journal= {arXiv preprint arXiv:2404.11938},
  year   = {2024}
}

备注

13 pages, IJCAI-2024