GRaSp:低数据任务中基于语境学习的自动示例优化
计算与语言
2026-05-11 v1
摘要
语境学习使大型语言模型能够适应新任务,但其性能对所选示例高度敏感。在数据稀缺的特定领域设置中,高质量示例难以获取。我们提出 GRaSp,一个三阶段框架用于自动语境示例优化。通过首先生成大型合成候选池,然后通过聚类和降维对其进行结构化,最后使用遗传算法寻找最佳语境示例,该框架在 NER 任务上表现出一致的改进。我们还引入了自定义的多样性自适应变异机制,使其能够从初始的广泛跨簇探索过渡到聚焦于簇内精炼,随着种群的收敛。我们在金融命名实体识别(FiNER-139)上评估了 GRaSp,比较了合成数据和人工标注的候选池,池规模为 500 和 5000。使用非合成数据,GRaSp 在微-F1 上达到 45.84%,在零样本和随机少样本基线中 consistently 优于后者。合成数据与随机基线相当,但未超过它,这表明候选池中的分布式多样性对于泛化至关重要。
引用
@article{arxiv.2605.07454,
title = {GRaSp: Automatic Example Optimization for In-Context Learning in Low-Data Tasks},
author = {Simen Bihaug-Frøyland and Henrik Brådland},
journal= {arXiv preprint arXiv:2605.07454},
year = {2026}
}
备注
12 pages, 5 figures