Python Jupyter 笔记本中的错误识别策略
软件工程
2022-07-20 v2
摘要
计算笔记本——如 Jupyter 或 Colab——将文本与数据分析代码相结合。它们已在数据科学与探索性数据分析领域无处不在。由于这些笔记本呈现出不同于传统 IDE 驱动编程的编程范式,调试计算笔记本的方式可能也有所不同是合乎情理的。更具体地说,由于创建笔记本融合了领域知识、统计分析与编程,笔记本用户在这些不同形式中发现并修复错误的方式可能不同。在本文中,我们提出一项探索性、观察性研究,关于 Python Jupyter 笔记本用户如何发现并理解笔记本中的潜在错误。通过对调查 R 笔记本用户错误识别策略的研究设计进行概念复现,我们向用户展示了预先填入常见笔记本错误的 Python Jupyter 笔记本——这些错误根植于统计数据分析、领域概念知识或编程之中。随后我们分析了研究参与者用于发现这些错误的策略,并确定了每种策略识别错误的成功程度。我们的结果表明,尽管笔记本编程环境不同于传统编程所用环境,调试策略仍相当相似。我们希望本文所呈现的见解将帮助笔记本工具设计者与教育者做出改进,使数据科学家更易于在他们编写的笔记本中发现错误。
引用
@article{arxiv.2203.16653,
title = {Error Identification Strategies for Python Jupyter Notebooks},
author = {Derek Robinson and Neil A. Ernst and Enrique Larios Vargas and Margaret-Anne D. Storey},
journal= {arXiv preprint arXiv:2203.16653},
year = {2022}
}
备注
11 pages, 5 listings, 7 tables, to be published at ICPC 2022