多模态可解释人工智能综述:过去、现在与未来
计算机视觉与模式识别
2024-12-19 v1 人工智能
计算与语言
机器学习
多媒体
摘要
人工智能(AI)通过计算能力的进步和大规模数据集的发展而迅速发展。然而,这种进展也加剧了解释AI模型“黑箱”性质的挑战。为了解决这些问题,可解释人工智能(XAI)应运而生,专注于透明度和可解释性,以增强人类对AI决策过程的理解和信任。在多模态数据融合和复杂推理场景的背景下,多模态可解释人工智能(MXAI)的提出整合了多种模态用于预测和解释任务。同时,大语言模型(LLM)的出现带来了自然语言处理的显著突破,但其复杂性进一步加剧了MXAI的问题。为了深入了解MXAI方法的发展,并为构建更透明、公平和可信的AI系统提供关键指导,我们从历史角度回顾了MXAI方法,并将其划分为四个时代:传统机器学习、深度学习、判别式基础模型和生成式LLM。我们还回顾了MXAI研究中使用的评估指标和数据集,最后讨论了未来的挑战和方向。与本综述相关的项目已创建于https://github.com/ShilinSun/mxai_review。
引用
@article{arxiv.2412.14056,
title = {A Review of Multimodal Explainable Artificial Intelligence: Past, Present and Future},
author = {Shilin Sun and Wenbin An and Feng Tian and Fang Nan and Qidong Liu and Jun Liu and Nazaraf Shah and Ping Chen},
journal= {arXiv preprint arXiv:2412.14056},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication