中文

MVEB:基于多视图熵瓶颈的自监督学习

计算机视觉与模式识别 2024-03-29 v1 人工智能

摘要

自监督学习旨在学习能够有效泛化到下游任务的表示。许多自监督方法将图像的两个视图同时作为输入和自监督信号,假设任一视图包含相同的任务相关信息,且共享信息(近似)足以预测下游任务。最近的研究表明,丢弃视图间未共享的多余信息可以提高泛化能力。因此,理想的表示既足以应对下游任务,又包含最少的多余信息,这被称为最小充分表示。可以通过最大化表示与监督视图之间的互信息并消除多余信息来学习这种表示。然而,互信息的计算是出了名的难以处理。在本工作中,我们提出了一种称为多视图熵瓶颈(MVEB)的目标函数,以有效地学习最小充分表示。MVEB 将最小充分学习简化为同时最大化两个视图嵌入之间的一致性和嵌入分布的微分熵。我们的实验证实,MVEB 显著提升了性能。例如,在线性评估中,它使用基础的 ResNet-50 主干网络在 ImageNet 上实现了 76.9\% 的 top-1 准确率。据我们所知,这是使用 ResNet-50 取得的新的 state-of-the-art 结果。

关键词

引用

@article{arxiv.2403.19078,
  title  = {MVEB: Self-Supervised Learning with Multi-View Entropy Bottleneck},
  author = {Liangjian Wen and Xiasi Wang and Jianzhuang Liu and Zenglin Xu},
  journal= {arXiv preprint arXiv:2403.19078},
  year   = {2024}
}

备注

Accepted by TPAMI