StaICC: 面向分类任务的 In-Context Learning 标准化评估
计算与语言
2025-04-21 v3 人工智能
摘要
分类任务在 In-Context Learning (ICL) 范式中受到广泛关注。然而,当前工作的评估基于互不相干的基准和设置,而其性能受到诸多显著因素的影响,如提示模板、数据抽样、指令等,这导致不同文献中结果存在显著不一致,阻碍公平比较或跨文献的元分析。因此,本文提出了一个标准化且易于使用的评估工具包 (StaICC),用于 In-Context 分类评估。对于常规分类任务,我们提供 StaICC-Normal,选取 10 个广泛使用的数据集,并生成固定形式的提示,以减轻实验实现之间的差异。为丰富本基准的使用,我们还提供子基准 StaICC-Diag,用于从多个方面诊断 ICL,以实现更稳健的推理处理。
引用
@article{arxiv.2501.15708,
title = {StaICC: Standardized Evaluation for Classification Task in In-context Learning},
author = {Hakaze Cho and Naoya Inoue},
journal= {arXiv preprint arXiv:2501.15708},
year = {2025}
}
备注
20 pages, 8 figures, 8 tables