中文

可解释且可解释的多模态大语言模型:综合概述

计算与语言 2024-12-04 v1

摘要

人工智能 (AI) 的快速发展已彻底变革了诸多领域,大语言模型 (LLMs) 和计算机视觉 (CV) 系统分别推动了自然语言理解和视觉处理方面的进步。这些技术的融合催生了多模态 AI 的兴起,使跨模态理解能够涵盖文本、视觉、音频和视频等多种模态。特别是,多模态大语言模型 (MLLMs) 已然成为一种强大的框架,展现出在图像-文本生成、视觉问答和跨模态检索等任务中令人瞩目的能力。尽管如此,MLLMs 的复杂性和规模带来了在可解释性和可解释性方面的重大挑战,这对于在高风险应用中建立透明度、可信度和可靠性至关重要。本文提供了关于 MLLMs 可解释性和可解释性的全面调查,提出了一种新框架,将现有研究分为三个视角:(I) 数据,(II) 模型,(III) 训练与推理。我们系统地分析了从 token 级别到嵌入级别表示的可解释性,评估了与体系结构分析和设计相关的方法,探讨了增强透明度的训练和推理策略。通过比较各种方法,我们确定了它们的优势和局限性,并提出了未来研究方向以解决多模态可解释性中尚未解决的挑战。这项调查为推动 MLLMs 的可解释性和透明度提供了基础资源,指导研究人员和实践者开发更具可解释性和可靠性的多模态 AI 系统。

关键词

引用

@article{arxiv.2412.02104,
  title  = {Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey},
  author = {Yunkai Dang and Kaichen Huang and Jiahao Huo and Yibo Yan and Sirui Huang and Dongrui Liu and Mengxi Gao and Jie Zhang and Chen Qian and Kun Wang and Yong Liu and Jing Shao and Hui Xiong and Xuming Hu},
  journal= {arXiv preprint arXiv:2412.02104},
  year   = {2024}
}