人类图表要点与LLM预测的一致性如何?基于不同布局柱状图的案例研究
人机交互
2024-09-24 v2
摘要
大语言模型(LLMs)已被用于多种可视化任务,但我们在多大程度上接近能够预测人类要点的感知感知型LLM?图形感知文献表明,人类图表要点对可视化设计选择(如空间布局)敏感。在本工作中,我们通过使用具有不同空间布局的柱状图作为案例研究,考察了LLM在生成要点时表现出的此类敏感程度。我们进行了三个实验,测试了四种常见柱状图布局:垂直并列、水平并列、重叠和堆叠。在实验1中,我们通过测试四种LLM、两种温度设置、九种图表规格和两种提示策略,确定了生成有意义图表要点的最优配置。我们发现即使是最先进的LLM也难以生成语义多样且事实准确的要点。在实验2中,我们使用最优配置为八种可视化(四种布局和两种数据集)在零样本和单样本设置下各生成了30个图表要点。与人类要点相比,我们发现LLM生成的要点往往与人类进行的比较类型不匹配。在实验3中,我们考察了图表上下文和数据对LLM要点的影响。我们发现,与人类不同,LLM对使用相同柱状布局的不同柱状图表现出比较类型的差异。总体而言,我们的案例研究评估了LLM模拟人类数据解读的能力,并指出了使用LLM预测人类图表要点方面的挑战和机遇。
引用
@article{arxiv.2408.06837,
title = {How Aligned are Human Chart Takeaways and LLM Predictions? A Case Study on Bar Charts with Varying Layouts},
author = {Huichen Will Wang and Jane Hoffswell and Sao Myat Thazin Thane and Victor S. Bursztyn and Cindy Xiong Bearfield},
journal= {arXiv preprint arXiv:2408.06837},
year = {2024}
}
备注
IEEE Transactions on Visualization and Computer Graphics (Proc. VIS 2024)