中文

绘制熊猫:面向 LLM 的绘图代码基准测试

软件工程 2025-02-27 v2 人工智能 机器学习

摘要

本文引入人类精选的 PandasPlotBench 数据集,旨在评估大语言模型(LLM)在视觉数据探索中作为助理的效果。我们的基准测试聚焦于根据自然语言指令生成可视化表格数据(如 Pandas DataFrame)的代码,补充当前评估工具的功能,扩充其覆盖范围。数据集包含 175 个独特任务。我们的实验在三个可视化库(Matplotlib、Seaborn 和 Plotly)上,对几款领先的大语言模型(LLMs)进行评估。我们展示了任务缩短对绘图能力的影响微弱,允许用户界面在不牺牲功能或准确性的前提下,容纳简洁的用户输入。我们的另一项发现表明,尽管 LLMs 在流行库如 Matplotlib 和 Seaborn 上表现良好,但在 Plotly 上仍面临挑战,这凸显了需要改进的领域。我们希望该基准的模块化设计能够拓宽当前关于生成可视化内容的研究范围。我们的数据集和基准代码已在线提供:https://huggingface.co/datasets/JetBrains-Research/PandasPlotBench;https://github.com/JetBrains-Research/PandasPlotBench。

关键词

引用

@article{arxiv.2412.02764,
  title  = {Drawing Pandas: A Benchmark for LLMs in Generating Plotting Code},
  author = {Timur Galimzyanov and Sergey Titov and Yaroslav Golubev and Egor Bogomolov},
  journal= {arXiv preprint arXiv:2412.02764},
  year   = {2025}
}

备注

5 pages