基于图的无监督解缠表示学习——通过多模态大语言模型
计算机视觉与模式识别
2024-07-30 v1 机器学习
摘要
解缠表示学习(DRL)旨在识别和分解观察背后的底层因素,从而促进数据感知和生成。然而,当前的DRL方法常常依赖语义因素在统计上独立的不切实际假设。实际情况下,这些因素可能存在相关性,而现有的解决方案尚未妥善处理这一挑战。为此,我们引入了基于双向加权图的框架,以学习因素的无因果属性及其复杂数据中的相互关系。具体而言,我们提出了一个基于 -VAE 的模块,用于提取因素作为图的初始节点,并利用多模态大语言模型(MLLM)发现并排序潜在相关性,从而更新加权边。通过整合这些互补模块,我们的模型成功实现了细粒度、实用且无监督的解缠。实验表明,我们的方法在解缠和重构方面表现优异。此外,该模型继承了来自 MLLM 的增强解释力和可泛化性。
引用
@article{arxiv.2407.18999,
title = {Graph-based Unsupervised Disentangled Representation Learning via Multimodal Large Language Models},
author = {Baao Xie and Qiuyu Chen and Yunnan Wang and Zequn Zhang and Xin Jin and Wenjun Zeng},
journal= {arXiv preprint arXiv:2407.18999},
year = {2024}
}
备注
9 pages, 7 figures