基于零样提示的分类:利用基础模型在德国推文中的主题标记
高能物理 - 理论
2024-09-23 v2
摘要
过滤和标注文本数据是许多领域(如社交媒体或新闻分析)中的常规任务。自动化这些任务可以加快分析速度和覆盖范围,并减少对手动工作量的要求。由于自然语言处理技术的进步,特别是大型基础模型的成功,一种通过文本-文本界面给定书面指导而无需提供训练样本即可自动化此类标注过程的新工具已可用。在本工作中,我们通过在关于欧洲社会和政治危机的德国推文数据上进行实证测试来评估这些进展。我们将提示基于的结果与人工标注和先前的分类方法进行比较,包括朴素贝叶斯和基于BERT的微调/域适应管道。我们的结果表明,提示基于的方法——尽管在模型选择期间受限于本地计算资源——在没有任何标注训练数据的情况下与微调的BERT相当。我们的发现强调了NLP领域正在进行的范式转变,即下游任务的统一以及无需预标记训练数据的消除。
引用
@article{arxiv.2406.18238,
title = {Nicolai maps and uniqueness in the light-cone gauge},
author = {Nipun Bhave and Saurabh Pant},
journal= {arXiv preprint arXiv:2406.18238},
year = {2024}
}
备注
22 Pages, minor additions, same as the published version but in a different formatting style