中文

MOSLD-Bench:面向文本分类的多语言开放集学习与发现基准

计算与语言 2026-01-21 v1 人工智能 机器学习

摘要

开放集学习与发现(OSLD)是一项具有挑战性的机器学习任务,在测试时可能会出现来自新(未知)类别的样本。它可以被视为零样本学习的推广,其中新类别并非先验已知,因此涉及对新类别的主动发现。尽管零样本学习在文本分类中已有广泛研究,尤其是在预训练语言模型出现之后,但开放集学习与发现对于文本领域而言是一个相对新颖的设置。为此,我们引入了首个用于按主题进行文本分类的多语言开放集学习与发现(MOSLD)基准,涵盖 12 种语言的 96 万个数据样本。为了构建该基准,我们 重新排列了现有数据集,并 从新闻领域收集了新的数据样本。此外,我们提出了一种用于 OSLD 任务的新颖框架,该框架集成了多个阶段以持续发现和学习新类别。我们评估了包括我们自研模型在内的多个语言模型,以获得可作为未来工作参考的结果。我们在 https://github.com/Adriana19Valentina/MOSLD-Bench 发布了我们的基准。

关键词

引用

@article{arxiv.2601.13437,
  title  = {MOSLD-Bench: Multilingual Open-Set Learning and Discovery Benchmark for Text Categorization},
  author = {Adriana-Valentina Costache and Daria-Nicoleta Dragomir and Silviu-Florin Gheorghe and Eduard Poesina and Paul Irofti and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2601.13437},
  year   = {2026}
}