中文

当前的 LLM 能否帮助非专业用户制作官方统计数据的图表?

信息检索 2025-10-03 v1

摘要

在偏见信息、深度伪造和宣传不断传播的时代,可靠数据来源的可及性比任何时候都更为重要。国家统计局提供的精选数据包含关于广泛主题的定量信息。然而,这些信息通常分散在多个表格中,纯粹的数字可能难以处理。因此,这些开放数据可能在实际中难以访问。我们提出了一个结构化评估框架,用于评估最近大型语言模型 (LLM) 在响应用户查询时生成图表的能力。我们与来自 Statistics Netherlands 的多样化公开数据合作,对多个 LLM 在识别相关数据表、执行必要数据处理和自主生成合适可视化方面的能力进行评估。我们提出了一个覆盖三个维度的新评估框架:数据检索与预处理、代码质量和视觉表现。结果表明,定位和处理正确数据是最大的挑战。此外,LLM 很少在没有明确指导的情况下实施可视化最佳实践。当辅以关于有效图表设计的信息时,模型在表示评分方面表现显著提升。此外,采用带有迭代自我评估的代理方法在所有评估维度上均表现出色。这些发现表明,通过适当的 scaffolding 和反馈机制,LLM 的自动图表生成效果可以得到提升,系统已经能够在三个评估维度上达到必要的准确性。

关键词

引用

@article{arxiv.2510.01197,
  title  = {Are LLMs ready to help non-expert users to make charts of official statistics data?},
  author = {Gadir Suleymanli and Alexander Rogiers and Lucas Lageweg and Jefrey Lijffijt},
  journal= {arXiv preprint arXiv:2510.01197},
  year   = {2025}
}