ModalityMirror: 用于多模态异构联邦学习中提升音频分类的多模态蒸馏
音频与语音处理
2024-08-29 v1 人工智能
声音
摘要
多模态联邦学习常面临客户端模态异构性挑战,导致二级模态在多模态学习中的性能不佳。这在音视频学习中尤为突出,音频常被假设为识别任务中的弱模态。为解决此挑战,我们引入 ModalityMirror 通过来自音视频联邦学习模型的知识蒸馏来提升音频模型性能。ModalityMirror 包含两个阶段:针对不同模态的 FL 阶段以聚合单模态编码器;以及在多模态客户端上进行联邦知识蒸馏阶段,以训练单模态学生模型。我们的结果表明,ModalityMirror 在提升音频分类方面显著优于诸如 Harmony 等最先进 FL 方法,尤其是在面对视频缺失的音视频联邦学习场景中。我们的ethods 解锁了挖掘多模态联邦学习中固有多样模态谱系的潜力。
引用
@article{arxiv.2408.15803,
title = {ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation},
author = {Tiantian Feng and Tuo Zhang and Salman Avestimehr and Shrikanth S. Narayanan},
journal= {arXiv preprint arXiv:2408.15803},
year = {2024}
}