中文

探索非平衡标注以实现有效的上下文学习

计算与语言 2025-06-02 v2 机器学习

摘要

大型语言模型(LLMs)通过上下文学习(ICL)在下游任务中展现出令人瞩目的性能,而上下文学习高度依赖于从标注数据集中选取的示例。然而,在现实场景中,这些数据集往往呈现长尾类别分布,导致示例选择存在偏差。本工作表明,无论采用何种选择方法,这种类别不平衡都会显著降低各类任务的上下文学习性能。此外,仅关注类别权重的经典重平衡方法由于忽略了条件偏差——即类别内偏斜的特征分布——而表现不佳。为解决此问题,我们提出了带条件偏差的重加权方法(简称RCB),这是一种简单且互补的方法,用于在类别不平衡下增强上下文学习性能。具体而言,RCB利用一个平衡子集估计条件偏差,并基于类别权重和条件偏差对示例得分进行重加权。实际上,RCB在保持当前选择方法有效性的同时,防止了从主导类别中过度选择。在常见基准上的大量实验证明了我们方法的有效性,将当前选择方法的平均准确率最高提升了5.42%。

关键词

引用

@article{arxiv.2502.04037,
  title  = {Exploring Imbalanced Annotations for Effective In-Context Learning},
  author = {Hongfu Gao and Feipeng Zhang and Hao Zeng and Deyu Meng and Bingyi Jing and Hongxin Wei},
  journal= {arXiv preprint arXiv:2502.04037},
  year   = {2025}
}