中文

面向极端多标签分类的上下文学习

计算与语言 2024-01-23 v1 人工智能

摘要

具有数千个类别的多标签分类问题很难仅通过上下文学习来解决,因为语言模型(LM)可能缺乏关于精确类别或如何分配类别的先验知识,并且通常无法在提示中演示每个类别。我们提出了一个通用程序 Infer--Retrieve--Rank\texttt{Infer--Retrieve--Rank},它定义了语言模型与检索器之间的多步交互,以高效处理此类问题。我们使用 DSPy\texttt{DSPy} 编程模型实现该程序,该模型以声明式方式指定上下文系统,并利用 DSPy\texttt{DSPy} 优化器,仅通过引导数十个少样本示例,即可针对特定数据集对其进行调优。我们的主要极端分类程序针对每个任务分别优化,在三个基准测试(HOUSE、TECH、TECHWOLF)上均取得了最先进的结果。我们将同一程序应用于一个具有截然不同特征的基准测试,也获得了有竞争力的性能(BioDEX)。与先前工作不同,我们提出的解决方案无需微调,易于应用于新任务,减轻了提示工程负担,且仅需数十个标注示例。我们的代码公开于 https://github.com/KarelDO/xmc.dspy。

关键词

引用

@article{arxiv.2401.12178,
  title  = {In-Context Learning for Extreme Multi-Label Classification},
  author = {Karel D'Oosterlinck and Omar Khattab and François Remy and Thomas Demeester and Chris Develder and Christopher Potts},
  journal= {arXiv preprint arXiv:2401.12178},
  year   = {2024}
}