大语言模型用于视觉分析综述
人机交互
2025-03-20 v1 计算与语言
计算机视觉与模式识别
摘要
本文提供了关于大型语言模型(LLMs)与视觉分析集成的全面综述,涵盖其基础概念、能力及广泛应用。文献首先阐述了视觉分析的理论基础以及大型语言模型的变革性潜力,具体聚焦其在自然语言理解、自然语言生成、对话系统和文本到媒体转换中的作用。综述进一步探讨了大型语言模型与视觉分析协同作用如何增强数据解释、可视化技术及交互式探索能力。关键工具和平台,包括 LIDA、Chat2VIS、Julius AI 和 Zoho Analytics,以及专用多模态模型如 ChartLlama 和 CharXIV,均得到批判性评估。文献讨论了这些工具在支持数据探索、可视化增强、自动化报告和洞察提取方面的功能、优势与局限。本综述系统地探索了大型语言模型任务的分类体系,从自然语言理解(NLU)、自然语言生成(NLG),到对话系统和文本到媒体转换。本综述对大型语言模型与视觉分析集成提供了SWOT分析,突出了像可访问性和灵活性这类优势,讨论了计算需求和偏见等弱点,探讨了多模态集成和用户协作的机遇,以及隐私关注和技能退化等威胁。文献强调要为有效集成而需解决伦理问题和方法学改进。
引用
@article{arxiv.2503.15176,
title = {A Review on Large Language Models for Visual Analytics},
author = {Navya Sonal Agarwal and Sanjay Kumar Sonbhadra},
journal= {arXiv preprint arXiv:2503.15176},
year = {2025}
}