中文

ARISE:迭代规则诱导与文本分类合成数据生成

计算与语言 2025-02-11 v1

摘要

我们提出ARISE,一个迭代诱导规则和生成合成数据用于文本分类的框架。我们通过自助法结合合成数据生成和自动规则诱导,迭代过滤生成的规则和数据。我们通过对句法n-gram的归纳泛化来诱导规则,从而捕获互补的监督来源。这些规则本身在both in-context learning(ICL)和fine-tuning(FT)设置下都能带来性能提升。类似地,使用ARISE生成的增强数据单独使用也能提升模型性能,显著优于依赖对比学习等复杂方法的配置。进一步地,我们在覆盖三个全量设置、八个少量量化和七个多语言变体的多个数据集上进行了广泛实验,表明我们生成的规则和数据在这些多样化的领域和语言中都能带来性能提升。

关键词

引用

@article{arxiv.2502.05923,
  title  = {ARISE: Iterative Rule Induction and Synthetic Data Generation for Text Classification},
  author = {Yashwanth M. and Vaibhav Singh and Ayush Maheshwari and Amrith Krishna and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2502.05923},
  year   = {2025}
}

备注

Accepted to Findings of NAACL 2025