BenTo:基于原语学习可迁移性的基准任务降低
计算与语言
2024-10-23 v3
摘要
评估大型语言模型(LLMs)成本高昂:需要在各种任务的大型基准测试上生成和检查LLM输出。本文研究如何在不影响评估质量的情况下有效减少用于评估LLMs的任务数量。我们的研究揭示,任务可迁移性和相关性提供了关键信息,可通过优化设施位置函数来识别最具代表性的任务子集。我们提出了一种实用且高效的指标,用于估计两个任务之间通过原语学习(ICL)的可迁移性。通过分析任务之间的双向可迁移性,我们可以将现代LLM基准(例如MMLU或FLAN)中的任务减少到5%,而仅引入<4%的评估差异。与先前工作相比,我们的方法无需训练、无需梯度,高度高效,仅需ICL。
引用
@article{arxiv.2410.13804,
title = {BenTo: Benchmark Task Reduction with In-Context Transferability},
author = {Hongyu Zhao and Ming Li and Lichao Sun and Tianyi Zhou},
journal= {arXiv preprint arXiv:2410.13804},
year = {2024}
}
备注
https://github.com/tianyi-lab/bento