中文

BYOC:基于协同撰写类描述的自个性化少样本分类

计算与语言 2023-10-11 v1 机器学习

摘要

文本分类是许多 NLP 应用中被充分研究且通用的构建模块。然而,现有方法要么需要大型标注语料库来训练模型,要么在使用大语言模型作为基础时需精心构造提示并采用能容纳大量示例的长上下文。因此,终端用户无法自行构建分类器。为解决此问题,我们提出一种使用 LLM 的少样本文本分类新方法。LLM 并非以少样本示例为提示,而是以每类显著特征的描述为提示。这些描述由用户与 LLM 交互式协同撰写:当用户标注每个少样本示例时,LLM 提出相关问题并由用户回答。示例、问题与答案被总结以形成分类提示。我们的实验表明,该方法可得到高精度分类器,在仅使用大型数据集 1% 训练集的情况下,达到以显著更大数据集训练的模型性能的 82%。此外,在一项有 30 名参与者的研究中,我们展示终端用户能够构建符合其特定需求的分类器。自个性化分类器平均准确率达 90%,比最先进方法高 15%。

关键词

引用

@article{arxiv.2310.06111,
  title  = {BYOC: Personalized Few-Shot Classification with Co-Authored Class Descriptions},
  author = {Arth Bohra and Govert Verkes and Artem Harutyunyan and Pascal Weinberger and Giovanni Campagna},
  journal= {arXiv preprint arXiv:2310.06111},
  year   = {2023}
}

备注

Accepted at EMNLP 2023 (Findings)