基于零样提示的分类:Foundation 模型时代德国推文的话题标注
计算与语言
2024-06-27 v1 人工智能
摘要
过滤和标注文本数据是许多领域(如社交媒体或新闻分析)中的常规任务。自动化这些任务允许缩放分析速度和内容覆盖范围,减少对手动工作量的要求。由于自然语言处理领域的技术进步,特别是大型基础模型的成功,一种通过文本-文本界面使用编写指南而无需提供训练样本的自动化标注工具变得可用。在本工作中,我们在德国推文数据上对社交和政治欧洲危机进行标注任务的测试方法进行了现场测试。我们将提示基于的结果与人工标注和先前的分类方法进行比较,包括朴素贝叶斯和基于 BERT 的微调/领域适应管道。我们的结果表明,提示基于的方法——尽管在模型选择期间受限于本地计算资源——在没有任何标注训练数据的情况下与微调的 BERT 持平。我们的发现强调了 NLP 领域正在发生的范式转变,即下游任务的统一以及无需预先标记训练数据的需求的消除。
引用
@article{arxiv.2406.18239,
title = {Zero-shot prompt-based classification: topic labeling in times of foundation models in German Tweets},
author = {Simon Münker and Kai Kugler and Achim Rettinger},
journal= {arXiv preprint arXiv:2406.18239},
year = {2024}
}
备注
10 pages, 2 tables, 1 figure