DRAFT:稠密检索增强的少样本主题分类器框架
信息检索
2023-12-06 v1 计算与语言
摘要
随着多样化信息量的不断增长,对任意主题进行分类的需求日益迫切。为了应对这一挑战,我们提出了 DRAFT,一个旨在为少样本主题分类训练分类器的简洁框架。DRAFT 以特定主题的少量样本作为查询,利用稠密检索模型构建定制化数据集 (Customized dataset)。我们采用多查询检索 (multi-query retrieval, MQR) 算法来有效处理与特定主题相关的多个查询,从而构建定制化数据集。随后,我们使用定制化数据集对分类器进行微调,以识别相应主题。为了证明所提方法的有效性,我们在广泛使用的分类基准数据集以及人工构建的涵盖 291 个多样化主题的数据集上进行了评估,后者模拟了真实世界应用中遇到的多样化内容。尽管参数量少了 177 倍,DRAFT 在少样本主题分类任务上仍展现出与使用上下文学习 (in-context learning) 的基线方法(如 GPT-3 175B 与 InstructGPT 175B)相当或更优的性能,证明了其有效性。
引用
@article{arxiv.2312.02532,
title = {DRAFT: Dense Retrieval Augmented Few-shot Topic classifier Framework},
author = {Keonwoo Kim and Younggun Lee},
journal= {arXiv preprint arXiv:2312.02532},
year = {2023}
}