数据可视化库中 bug 的实证研究
软件工程
2025-06-19 v1 计算机视觉与模式识别
人机交互
摘要
数据可视化 (DataViz) 库在呈现、数据分析和应用开发中发挥着关键作用,凸显了其在将数据转化为视觉表示方面的准确性至关重要。不正确的可视化可能对用户体验产生不利影响,扭曲信息传递,并影响用户感知和决策过程。DataViz 库中的视觉 bug 尤为隐蔽,因为它们可能不会导致明显的错误如崩溃,反而可能误导用户对底层数据的图形化表示,从而导致错误决策。因此,深入了解 DataViz 库中 bug 的独特特征对研究人员和开发者至关重要,以便检测和修复 DataViz 库中的 bug。本研究首次对 DataViz 库中的 bug 进行全面分析,收集来自五个广泛使用库的 564 个 bug。我们的研究系统性地分析了这些 bug 的症状和根本原因,并提供了详细的分类法。我们发现,错误/不准确的图表在 DataViz 库中普遍存在,而错误的图形计算是主要的根本原因,这 necessitates 进一步的自动化测试方法。此外,我们识别了触发此类 bug 的八个关键步骤和两个特定于 DataViz 库的测试信标,这可能为设计有效的自动化测试技术提供灵感。此外,随着视觉语言模型 (VLMs) 最近的进展,我们探讨了将这些模型应用于检测错误/不准确图表的可行性。结果表明,VLMs 在 bug 检测中的效果因提示而异,范围从 29% 到 57%,而增加更多信息的提示并不一定会提高效果。更多发现可在本稿中查阅。
引用
@article{arxiv.2506.15084,
title = {An Empirical Study of Bugs in Data Visualization Libraries},
author = {Weiqi Lu and Yongqiang Tian and Xiaohan Zhong and Haoyang Ma and Zhenyang Xu and Shing-Chi Cheung and Chengnian Sun},
journal= {arXiv preprint arXiv:2506.15084},
year = {2025}
}
备注
Proc. ACM Softw. Eng. 2, FSE