中文

孟加拉语文档的零样本多标签分类:大型解码器对比经典编码器

计算与语言 2025-03-06 v1 信息检索

摘要

孟加拉语是一种拥有超过 3 亿母语使用者、全球第六大使用人数的语言,由于其复杂的形态特征和有限的资源,在自然语言处理(NLP)中呈现出独特的挑战。虽然近期基于大型解码器的模型(LLM),如 GPT、LLaMA 和 DeepSeek,在许多 NLP 任务上展现了出色的性能,但它们在孟加拉语上的有效性尚未得到充分探索。在本文中,我们建立了首个基准,比较基于解码器的 LLM 与经典基于编码器的模型在孟加拉语零样本多标签分类(Zero-Shot-MLC)任务上的表现。我们对 32 种最先进模型的评估显示,现有的所谓强大编码器和解码器在孟加拉语零样本-MLC 任务上仍然难以达到高精度,这表明孟加拉语 NLP 领域需要更多的研究和资源。

关键词

引用

@article{arxiv.2503.02993,
  title  = {Zero-Shot Multi-Label Classification of Bangla Documents: Large Decoders Vs. Classic Encoders},
  author = {Souvika Sarkar and Md. Najib Hasan and Santu Karmaker},
  journal= {arXiv preprint arXiv:2503.02993},
  year   = {2025}
}