中文

探索科学可视化中LLM智能体的交互范式

人工智能 2026-05-14 v2 图形学 人机交互

摘要

本文考察了不同类型的大语言模型(LLM)智能体在科学可视化(SciVis)任务中的表现,这些任务要求用户根据自然语言指令生成可视化工作流。我们通过评估八种代表性智能体在15项基准任务上的表现,并测量可视化质量、效率、鲁棒性和计算成本,比较了三种主要的交互范式,包括使用结构化工具的领域特定智能体、计算机使用智能体和通用编码智能体。我们进一步分析了交互模态,包括用于结构化工具调用的代码脚本和模型上下文协议(MCP)或API调用,以及用于更通用交互的命令行界面(CLI)和图形用户界面(GUI),同时还研究了持久记忆在选定智能体中的效果。结果揭示了不同范式和模态之间的明确权衡。通用编码智能体实现了最高的任务成功率,但计算成本高昂,而领域特定智能体则更高效、更稳定,但灵活性较差。计算机使用智能体在单个步骤上表现良好,但在较长的多步骤工作流中表现挣扎,表明长期规划是其主要限制。在基于CLI和GUI的设置中,持久记忆都能通过重复试验提高性能,尽管其益处取决于底层的交互模式和反馈质量。这些发现表明,没有单一方法足够,未来的SciVis系统应结合结构化工具使用、交互能力和自适应记忆机制,以平衡性能、鲁棒性和灵活性。

关键词

引用

@article{arxiv.2604.27996,
  title  = {Exploring Interaction Paradigms for LLM Agents in Scientific Visualization},
  author = {Jackson Vonderhorst and Kuangshi Ai and Haichao Miao and Shusen Liu and Chaoli Wang},
  journal= {arXiv preprint arXiv:2604.27996},
  year   = {2026}
}