中文

暂时使用随机选择:基于LLM的文本增强分类中小样本选择策略研究

计算与语言 2024-10-15 v1

摘要

生成式大语言模型(LLMs)越来越多地被用于数据增强任务,其中文本样本被释义(或重新生成),然后用于分类器微调。现有的增强研究利用了少样本场景,即样本作为提示的一部分提供给LLM,从而获得更好的增强效果。然而,样本大多是随机选择的,缺乏对其他(更“知情”)样本选择策略影响的全面概述。在这项工作中,我们比较了少样本学习文献中存在的样本选择策略,并研究了它们在基于LLM的文本增强中的效果。我们从分布内和分布外分类器性能两方面进行评估。结果表明,虽然一些“知情”的选择策略提高了模型的性能,特别是在分布外数据上,但这种情况很少发生,且性能提升幅度很小。除非取得进一步进展,默认的随机样本选择对于增强实践者来说仍然是一个不错的选择。

关键词

引用

@article{arxiv.2410.10756,
  title  = {Use Random Selection for Now: Investigation of Few-Shot Selection Strategies in LLM-based Text Augmentation for Classification},
  author = {Jan Cegin and Branislav Pecher and Jakub Simko and Ivan Srba and Maria Bielikova and Peter Brusilovsky},
  journal= {arXiv preprint arXiv:2410.10756},
  year   = {2024}
}