TaskComplexity:用于 In-Context Learning、FLAN-T5 和 GPT-4o 基准的任务复杂性分类数据集
计算与语言
2024-10-01 v1
摘要
本文解决了将编程任务分配给专家的挑战,这一过程通常需要大量时间和成本。为此,创建了一个包含4112个编程任务的新型数据集,通过从多个网站中提取任务来构建。采用网页抓取技术系统地收集了该编程问题数据集。跟踪特定的HTML标签以提取每个问题的关键元素,包括标题、问题描述、输入输出、示例、问题类别和复杂度评分。数据集中的示例见附录,以说明所包含任务的多样性和复杂性。对数据集的有效性进行了评估和基准测试,采用两种方法:第一种方法是在数据集上对FLAN-T5小型模型进行微调,第二种方法使用GPT-4o-mini进行情境学习(ICL)。采用标准指标进行性能评估:准确率、召回率、精确率和F1分数。结果表明,与FLAN-T5模型相比,情境学习使用GPT-4o-mini的性能更优。
引用
@article{arxiv.2409.20189,
title = {TaskComplexity: A Dataset for Task Complexity Classification with In-Context Learning, FLAN-T5 and GPT-4o Benchmarks},
author = {Areeg Fahad Rasheed and M. Zarkoosh and Safa F. Abbas and Sana Sabah Al-Azzawi},
journal= {arXiv preprint arXiv:2409.20189},
year = {2024}
}
备注
This papaer has been accepted to The 3nd International conference on Machine Learning and Data Engineering (ICMLDE 2024)