中文

StaICC: 面向分类任务的 In-Context Learning 标准化评估

计算与语言 2025-04-21 v3 人工智能

摘要

分类任务在 In-Context Learning (ICL) 范式中受到广泛关注。然而,当前工作的评估基于互不相干的基准和设置,而其性能受到诸多显著因素的影响,如提示模板、数据抽样、指令等,这导致不同文献中结果存在显著不一致,阻碍公平比较或跨文献的元分析。因此,本文提出了一个标准化且易于使用的评估工具包 (StaICC),用于 In-Context 分类评估。对于常规分类任务,我们提供 StaICC-Normal,选取 10 个广泛使用的数据集,并生成固定形式的提示,以减轻实验实现之间的差异。为丰富本基准的使用,我们还提供子基准 StaICC-Diag,用于从多个方面诊断 ICL,以实现更稳健的推理处理。

关键词

引用

@article{arxiv.2501.15708,
  title  = {StaICC: Standardized Evaluation for Classification Task in In-context Learning},
  author = {Hakaze Cho and Naoya Inoue},
  journal= {arXiv preprint arXiv:2501.15708},
  year   = {2025}
}

备注

20 pages, 8 figures, 8 tables