Political DEBATE:面向政治文本的高效零样本和少样本分类器
计算与语言
2026-01-14 v1
摘要
社会科学家迅速采用大型语言模型,由于其无需监督训练即可标注文档的能力,这一能力被称为零样本学习。然而,由于其计算需求、成本和常常的专有属性,这些模型常常与复制科学和开放科学标准相矛盾。本文介绍了 Political DEBATE(DeBERTa Algorithm for Textual Entailment)语言模型,用于政治文档的零样本和少样本分类。这些模型不仅在零样本和少样本分类方面与最先进的大型语言模型一样好或更好,而且计算效率高出数个数量级且完全开源。通过在简单随机抽取的 10-25 份文档上训练,即可超过在数百或数千份文档上训练的受监督分类器,以及使用复杂人工工程提示词的领先生成模型。此外,我们发布了用于训练这些模型的 PolNLI 数据集——一个包含超过 20 万份政治文档的语料库,涵盖超过 800 个分类任务,并具有高度准确的标签。
引用
@article{arxiv.2409.02078,
title = {Political DEBATE: Efficient Zero-shot and Few-shot Classifiers for Political Text},
author = {Michael Burnham and Kayla Kahn and Ryan Yank Wang and Rachel X. Peng},
journal= {arXiv preprint arXiv:2409.02078},
year = {2026}
}
备注
26 pages, 5 figures