中文

基于树的线性模型在极端多标签分类中的空间效率探索

机器学习 2024-10-15 v1 计算与语言

摘要

极端多标签分类(XMC)旨在从大量标签中识别相关子集。在XMC的各种方法中,基于树的线性模型因其卓越的效率和简单性而有效。然而,树基于方法的空间复杂度尚未得到充分研究。许多过去的工作假设存储模型不可行,采用修剪等技术以节省空间,这可能会导致性能损失。本文我们在稀疏数据假设下,对存储树模型的空间进行了理论和实证分析,这种条件在文本数据中经常满足。我们发现,某些特征在树方法中训练二分类器时可能未被使用,导致权向量中出现零值。因此,仅存储非零元素可大幅节省空间。我们的实验结果表明,针对多标签文本分类,树模型可实现相对于标准的基于一对剩余方法的存储空间降低最高达95%。我们的研究提供了一种在树节点中训练任何分类器前估算树模型大小的简单方法。然后,如果模型大小已经可接受,该方法可帮助避免通过权重修剪或其他技术来修改模型。

关键词

引用

@article{arxiv.2410.09554,
  title  = {Exploring space efficiency in a tree-based linear model for extreme multi-label classification},
  author = {He-Zhe Lin and Cheng-Hung Liu and Chih-Jen Lin},
  journal= {arXiv preprint arXiv:2410.09554},
  year   = {2024}
}

备注

EMNLP 2024