利用大型多模态模型解释生成模型的潜在表示
机器学习
2024-04-19 v3 人工智能
计算与语言
计算机视觉与模式识别
摘要
学习数据生成交互潜在因子的可解释表示是人工智能发展的重要课题。随着大型多模态模型的兴起,其能够将图像与文本对齐以生成答案。在本工作中,我们提出了一种框架,利用大型多模态模型全面解释生成模型中的每个潜在变量。我们进一步测量了所生成解释的不确定性,定量评估了多个大型多模态模型在解释生成方面的性能,并定性可视化了每个潜在变量的变化,以学习不同生成模型对解释的解耦效果。最后,我们讨论了最先进的大型多模态模型的解释能力及其局限性。
引用
@article{arxiv.2402.01858,
title = {Explaining latent representations of generative models with large multimodal models},
author = {Mengdan Zhu and Zhenke Liu and Bo Pan and Abhinav Angirekula and Liang Zhao},
journal= {arXiv preprint arXiv:2402.01858},
year = {2024}
}
备注
ICLR 2024 Workshop on Reliable and Responsible Foundation Models