自己做基准(Benchmark It Yourself, BIY):为散点图相关任务准备数据集与基准测试
机器学习
2025-10-08 v1 人工智能
人机交互
摘要
AI 模型正在越来越多地用于数据分析和可视化,但类基准测试很少针对散点图特定任务进行,限制了对性能的洞察。为填补这一空白,针对最常见的图表类型,我们引入一个由六个数据生成器和 17 种图表设计组成的超过 18,000 个带注释的合成散点图数据集,以及基于该数据集的基准测试。我们评估了来自 OpenAI 和 Google 的专有模型,针对从集群边界框、其中心坐标和异常值坐标中提取的五个不同任务进行 N 次样本提示。OpenAI 模型和 Gemini 2.5 Flash,尤其是在带有示例的提示下,能够为计数集群以及在 Flash 情况下的异常值(准确率 90%+)提供可行选项。然而,针对局部化相关任务的结果令人不满意:精确率和召回率接近或低于 50%,除非在异常值识别中使用 Flash(65.01%)。此外,图表设计对性能的影响似乎是次要因素,但建议避免使用宽长宽高比(16:9 和 21:9)或随机着色的散点图。补充材料可在 https://github.com/feedzai/biy-paper 上获取。
引用
@article{arxiv.2510.06071,
title = {Benchmark It Yourself (BIY): Preparing a Dataset and Benchmarking AI Models for Scatterplot-Related Tasks},
author = {João Palmeiro and Diogo Duarte and Rita Costa and Pedro Bizarro},
journal= {arXiv preprint arXiv:2510.06071},
year = {2025}
}
备注
9 pages, 3 figures, short paper accepted at VISxGenAI: 1st Workshop on GenAI, Agents, and the Future of VIS (IEEE VIS 2025)