一种用于多模态数据受控解耦的信息准则
机器学习
2025-03-18 v2 人工智能
信息论
math.IT
摘要
多模态表示学习旨在关联和分解多种模态中固有的信息。通过将模态特定信息与跨模态共享信息解耦,我们可以提高可解释性和鲁棒性,并支持下游任务,例如生成反事实结果。分离这两类信息具有挑战性,因为它们在许多现实世界应用中常常深度纠缠。我们提出了解耦自监督学习(DisentangledSSL),这是一种用于学习解耦表示的新型自监督方法。我们对每种解耦表示的最优性进行了全面分析,特别关注了先前工作未涵盖的场景,即所谓的“最小必要信息”(MNI)点无法达到的情况。我们证明,DisentangledSSL 在多个合成和真实世界数据集上成功学习了共享和模态特定特征,并在各种下游任务中持续优于基线方法,这些任务包括视觉-语言数据的预测任务,以及生物数据的分子-表型检索任务。代码可在 https://github.com/uhlerlab/DisentangledSSL 获取。
引用
@article{arxiv.2410.23996,
title = {An Information Criterion for Controlled Disentanglement of Multimodal Data},
author = {Chenyu Wang and Sharut Gupta and Xinyi Zhang and Sana Tonekaboni and Stefanie Jegelka and Tommi Jaakkola and Caroline Uhler},
journal= {arXiv preprint arXiv:2410.23996},
year = {2025}
}
备注
ICLR 2025