大语言模型来救场:利用ChatGPT降低科学工作流开发的复杂度
分布式、并行与集群计算
2024-07-09 v2 计算与语言
人机交互
摘要
科学工作流系统日益流行,用于在大型数据集上表达和执行复杂的数据分析流水线,因为它们通过在大型计算集群上自动并行化提供了分析的可复现性、可靠性和可扩展性。然而,由于涉及众多黑盒工具以及执行所需深层基础设施栈,工作流的实现十分困难。同时,用户支持工具稀少,可用示例数量远少于经典编程语言。为应对这些挑战,我们研究了大语言模型(LLMs),特别是 ChatGPT,在用户处理科学工作流时提供支持的效率。我们在两个科学领域进行了三项用户研究,以评估 ChatGPT 在理解、改编和扩展工作流方面的表现。我们的结果表明,LLM 能高效解释工作流,但在替换组件或有意扩展工作流时性能较低。我们刻画了其在这些挑战性场景中的局限性,并提出了未来研究方向。
引用
@article{arxiv.2311.01825,
title = {Large Language Models to the Rescue: Reducing the Complexity in Scientific Workflow Development Using ChatGPT},
author = {Mario Sänger and Ninon De Mecquenem and Katarzyna Ewa Lewińska and Vasilis Bountris and Fabian Lehmann and Ulf Leser and Thomas Kosch},
journal= {arXiv preprint arXiv:2311.01825},
year = {2024}
}