中文

一种用于多模态数据受控解耦的信息准则

机器学习 2025-03-18 v2 人工智能 信息论 math.IT

摘要

多模态表示学习旨在关联和分解多种模态中固有的信息。通过将模态特定信息与跨模态共享信息解耦,我们可以提高可解释性和鲁棒性,并支持下游任务,例如生成反事实结果。分离这两类信息具有挑战性,因为它们在许多现实世界应用中常常深度纠缠。我们提出了解耦自监督学习(DisentangledSSL),这是一种用于学习解耦表示的新型自监督方法。我们对每种解耦表示的最优性进行了全面分析,特别关注了先前工作未涵盖的场景,即所谓的“最小必要信息”(MNI)点无法达到的情况。我们证明,DisentangledSSL 在多个合成和真实世界数据集上成功学习了共享和模态特定特征,并在各种下游任务中持续优于基线方法,这些任务包括视觉-语言数据的预测任务,以及生物数据的分子-表型检索任务。代码可在 https://github.com/uhlerlab/DisentangledSSL 获取。

关键词

引用

@article{arxiv.2410.23996,
  title  = {An Information Criterion for Controlled Disentanglement of Multimodal Data},
  author = {Chenyu Wang and Sharut Gupta and Xinyi Zhang and Sana Tonekaboni and Stefanie Jegelka and Tommi Jaakkola and Caroline Uhler},
  journal= {arXiv preprint arXiv:2410.23996},
  year   = {2025}
}

备注

ICLR 2025