多样本自生成标注上下文学习的缩放定律
计算与语言
2025-05-22 v2 人工智能
信息检索
机器学习
摘要
获取高质量标注数据以用于上下文学习(ICL)的成本高昂,这推动了使用自生成标注替代真实标签的方法的发展。虽然这些方法在少样本设置中已展现出有前景的结果,但它们通常无法扩展到多样本场景。在本工作中,我们使用类似于传统半监督学习的框架研究自生成样本的上下文学习,该框架由标注生成、样本选择和上下文推理组成。在该框架下,我们提出了一种简单的基线方法,在零样本、少样本和多样本设置中均优于真实标注 ICL。特别地,我们观察到该基线存在缩放定律,即最优性能在使用超过 1,000 个样本时实现。为充分利用半监督 ICL 的多样本能力,我们引入了 IterPSD,一种迭代标注方法,它整合了半监督学习中的迭代精修和课程式伪标注技术,在分类任务上实现了高达 6.8% 的额外增益。
引用
@article{arxiv.2503.03062,
title = {Scaling Laws for Many-Shot In-Context Learning with Self-Generated Annotations},
author = {Zhengyao Gu and Henry Peng Zou and Yankai Chen and Aiwei Liu and Weizhi Zhang and Philip S. Yu},
journal= {arXiv preprint arXiv:2503.03062},
year = {2025}
}