通过样本级注意力表示融合与模拟扰动对齐实现鲁棒多视图学习
计算机视觉与模式识别
2025-07-25 v2 人工智能
机器学习
摘要
近年来,多视图学习(MVL)因其融合来自多个视图的判别信息的能力而受到广泛关注。然而,真实世界的多视图数据集往往是异构且不完整的,这通常导致为特定视图组合设计的MVL方法缺乏应用潜力并限制了其有效性。为了解决这一问题,我们提出了一种新颖的鲁棒MVL方法(即RML),具有同时的表示融合与对齐。具体而言,我们引入了一个简单而有效的多视图变换器融合网络,将异构多视图数据转换为同质词嵌入,然后通过样本级注意力机制整合多个视图以获得融合表示。此外,我们提出了一种基于模拟扰动的多视图对比学习框架,动态生成噪声和不可用扰动以模拟不完整的数据条件。模拟的噪声和不可用数据获得两种不同的融合表示,我们利用对比学习对它们进行对齐以学习判别性和鲁棒的表示。我们的RML是自监督的,也可以作为正则化器应用于下游任务。在实验中,我们将其应用于多视图无监督聚类、噪声标签分类以及作为跨模态哈希检索的即插即用模块。广泛的对比实验和消融研究验证了RML的有效性。代码可在 https://github.com/SubmissionsIn/RML 获取。
引用
@article{arxiv.2503.04151,
title = {Robust Multi-View Learning via Representation Fusion of Sample-Level Attention and Alignment of Simulated Perturbation},
author = {Jie Xu and Na Zhao and Gang Niu and Masashi Sugiyama and Xiaofeng Zhu},
journal= {arXiv preprint arXiv:2503.04151},
year = {2025}
}