中文

ModalityMirror: 用于多模态异构联邦学习中提升音频分类的多模态蒸馏

音频与语音处理 2024-08-29 v1 人工智能 声音

摘要

多模态联邦学习常面临客户端模态异构性挑战,导致二级模态在多模态学习中的性能不佳。这在音视频学习中尤为突出,音频常被假设为识别任务中的弱模态。为解决此挑战,我们引入 ModalityMirror 通过来自音视频联邦学习模型的知识蒸馏来提升音频模型性能。ModalityMirror 包含两个阶段:针对不同模态的 FL 阶段以聚合单模态编码器;以及在多模态客户端上进行联邦知识蒸馏阶段,以训练单模态学生模型。我们的结果表明,ModalityMirror 在提升音频分类方面显著优于诸如 Harmony 等最先进 FL 方法,尤其是在面对视频缺失的音视频联邦学习场景中。我们的ethods 解锁了挖掘多模态联邦学习中固有多样模态谱系的潜力。

关键词

引用

@article{arxiv.2408.15803,
  title  = {ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation},
  author = {Tiantian Feng and Tuo Zhang and Salman Avestimehr and Shrikanth S. Narayanan},
  journal= {arXiv preprint arXiv:2408.15803},
  year   = {2024}
}