Themisto:基于 Jupyter 的运行时基准测试
软件工程
2025-04-18 v1 人工智能
机器学习
摘要
在本工作中,我们提出了一个由 Jupyter notebook 开发轨迹组成的基准测试,用于衡量大型语言模型(LLMs)如何利用运行时信息来预测代码输出与生成代码。我们证明当前一代 LLMs 在这些任务上表现不佳,并指出在基于代码的模型开发中存在一个严重研究不足的领域,即如何纳入运行时上下文。
引用
@article{arxiv.2504.12365,
title = {Themisto: Jupyter-Based Runtime Benchmark},
author = {Konstantin Grotov and Sergey Titov},
journal= {arXiv preprint arXiv:2504.12365},
year = {2025}
}
备注
Accepted to the third Deep Learning for Code (DL4C) workshop @ ICLR 2025