中文

DAIL:基于自 paraphrasing 的上下文学习数据增强

计算与语言 2023-11-07 v1 人工智能

摘要

上下文学习 (ICL) 结合预训练大语言模型已在各种 NLP 任务上取得有前景的结果。然而,ICL 需要高质量的标注示范,而在真实场景中可能无法获得。为克服此限制,我们提出 \textbf{D}ata \textbf{A}ugmentation for \textbf{I}n-Context \textbf{L}earning (\textbf{DAIL})。DAIL 利用大语言模型更熟悉自身生成内容的直觉。它首先利用语言模型生成测试样本的 paraphrases,并基于个体预测采用多数投票确定最终结果。我们广泛的实证评估表明,在低资源场景下 DAIL 优于标准 ICL 方法和其他基于集成的方法。此外,我们探索在预测 logits 不可访问时,使用投票一致性作为模型的置信度分数。我们相信我们的工作将激发对低资源环境下 ICL 的进一步研究。

关键词

引用

@article{arxiv.2311.03319,
  title  = {DAIL: Data Augmentation for In-Context Learning via Self-Paraphrase},
  author = {Dawei Li and Yaxuan Li and Dheeraj Mekala and Shuyao Li and Yulin wang and Xueqi Wang and William Hogan and Jingbo Shang},
  journal= {arXiv preprint arXiv:2311.03319},
  year   = {2023}
}

备注

Course project for DSC 253 (Advanced Data-Driven Text Mining) at UCSD