探索大语言模型的多模态提示用于可视化创作
系统与控制
2025-05-09 v2 多智能体系统
系统与控制
摘要
近年来,大语言模型 (LLM) 的进展显示出在通过简单自然语言语句自动化可视化创作方面的巨大潜力。然而,仅用自然语言指示 LLM 在传递可视化意图方面受限于精确性和表达性,导致误解和耗时的迭代。为此,我们开展实证研究,理解 LLM 在可视化创作情境下如何解释模糊或不完整的文本提示,以及何种条件使 LLM 误解用户意图。基于我们的发现,我们引入视觉提示作为补充的输入模态,以帮助澄清用户意图并提高 LLM 的解释能力。为探索多模态提示在可视化创作中的潜力,我们设计了 VisPilot,使用户能够使用包括文本、草图以及对现有可视化的直接操作等多模态提示轻松创建可视化。通过两个案例研究和受控用户研究,我们证明 VisPilot 提供了一种比仅用文本提示更直观的方式来创建可视化,且不会影响整体任务效率。此外,我们分析了文本提示和视觉提示在不同可视化任务中的影响。我们的发现突显了多模态提示在提高 LLM 为可视化创作 usability 中的重要性。我们讨论了未来可视化系统的设计含义,并提供了关于如何通过多模态提示增强人机协作在创造性可视化任务中的洞见。所有材料均可在 https://OSF.IO/2QRAK 获取。
引用
@article{arxiv.2504.13701,
title = {Inverse Inference on Cooperative Control of Networked Dynamical Systems},
author = {Yushan Li and Jianping He and Dimos V. Dimarogonas},
journal= {arXiv preprint arXiv:2504.13701},
year = {2025}
}
备注
14 pages