净化后对齐:基于无噪声多模态教师从噪声多模态教师进行知识蒸馏的鲁棒人类感知
计算机视觉与模式识别
2026-04-09 v2
摘要
鲁棒的多模态人类感知必须克服缺失模态的关键挑战。两个主要障碍是异构数据之间的表示差距以及来自低质量模态的污染效应。这些障碍因果相关,因为污染 fundamentally 阻碍了减少表示差异的能力。在本文中,我们提出了 PTA,即一种 novel "净化后对齐" 框架,通过 meta 学习和知识扩散的协同集成来解决这种因果依赖。为净化知识来源,PTA 首先采用基于 meta 学习的加权机制动态学习对噪声、低贡献模态的影响进行降权。随后,为对齐不同模态,PTA 引入一种基于扩散的知识蒸馏范式,其中来自该净化共识的、信息丰富的干净教师,从而细化每个学生模态的特征。这种 "净化后对齐" 策略的最终收益是创建具有跨模态知识的强大单模态编码器。在显著表示差距和污染效应的情况下,我们在大型 MM-Fi 和 XRF55 数据集上进行了全面实验,表明 PTA 实现了最先进的性能,并显著提高了在各种缺失模态情景下单模态模型的鲁棒性。
引用
@article{arxiv.2604.05584,
title = {Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher},
author = {Pengcheng Weng and Yanyu Qian and Yangxin Xu and Fei Wang},
journal= {arXiv preprint arXiv:2604.05584},
year = {2026}
}
备注
Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning