中文

PICLe: 低资源命名实体检测中用于上下文学习的伪标注

计算与语言 2025-04-02 v2 人工智能

摘要

上下文学习(ICL)使大语言模型(LLMs)能够使用少量示例执行任务,从而在难以获得标注示例时促进任务适应。然而,ICL对示例的选择敏感,目前尚不清楚哪些示例属性能够实现上下文泛化。本文对低资源命名实体检测(NED)中的上下文示例进行了扰动研究。我们的惊人发现是,具有部分正确标注实体提及的上下文示例在任务迁移中与完全正确的示例同样有效。基于此发现,我们提出伪标注上下文学习(PICLe),一种使用带噪声的伪标注示例进行上下文学习的框架。PICLe利用LLM在零样本首轮中标注大量示例。然后我们聚类这些合成示例,从每个聚类中采样特定的上下文示例集,并独立使用每组预测实体提及。最后,我们使用自验证选择最终的实体提及集。我们在五个生物医学NED数据集上评估PICLe,结果表明,在零人工标注的情况下,PICLe在低资源设置下优于使用有限金标准示例作为上下文示例的ICL。

关键词

引用

@article{arxiv.2412.11923,
  title  = {PICLe: Pseudo-Annotations for In-Context Learning in Low-Resource Named Entity Detection},
  author = {Sepideh Mamooler and Syrielle Montariol and Alexander Mathis and Antoine Bosselut},
  journal= {arXiv preprint arXiv:2412.11923},
  year   = {2025}
}

备注

In Proceedings of NAACL2025