TELeR:面向复杂任务基准测试的LLM提示通用分类法
人工智能
2023-10-26 v2 计算与语言
信息检索
机器学习
摘要
尽管LLMs在传统对话场景中的文本理解与生成已展现巨大成功,但其在执行定义不清的复杂任务方面的潜力很大程度上未被充分研究。确实,我们尚未开展专注于单一复杂任务、涵盖多个LLMs的综合性基准测试研究。然而,开展此类基准测试研究具有挑战性,因为使用不同提示类型/风格以及在提示中提供不同详尽程度时,LLMs性能差异巨大。为解决此问题,本文提出一种通用分类法,可用于设计具备特定属性的提示以执行广泛复杂任务。该分类法将使未来基准测试研究能报告研究中使用的特定提示类别,从而实现跨不同研究的有意义比较。此外,通过此分类法建立通用标准,研究人员将能对LLMs在特定复杂任务上的表现得出更准确结论。
引用
@article{arxiv.2305.11430,
title = {TELeR: A General Taxonomy of LLM Prompts for Benchmarking Complex Tasks},
author = {Shubhra Kanti Karmaker Santu and Dongji Feng},
journal= {arXiv preprint arXiv:2305.11430},
year = {2023}
}
备注
Accepted to EMNLP 2023