用于多标签文档分类的章节权重学习
计算与语言
2023-11-28 v1
摘要
多标签文档分类是 NLP 中的传统任务。与单标签分类相比,每篇文档可被赋予多个类别。该问题在诸如科学文章标注等多个领域中至关重要。文档常结构化为摘要、标题等若干章节。当前方法在多标签分类中对不同章节同等对待。我们认为这不切实际,会导致次优结果。相反,我们提出一种称为章节权重学习(LSW)的新方法,利用各不同章节对多标签分类的贡献。通过多个前馈层,LSW 学习为文档的每个章节分配权重,并将权重纳入预测。我们在科学文章上演示了该方法。在公共(arXiv)与私有(Elsevier)数据集上的实验结果证实了 LSW 相对于最先进多标签文档分类方法的优越性。具体而言,在公开可用的 arXiv 数据集上,LSW 在宏平均 F1 分数上取得 1.3% 的提升,同时在宏平均召回率上取得 1.3% 的提升。
引用
@article{arxiv.2311.15402,
title = {Learning Section Weights for Multi-Label Document Classification},
author = {Maziar Moradi Fard and Paula Sorrolla Bayod and Kiomars Motarjem and Mohammad Alian Nejadi and Saber Akhondi and Camilo Thorne},
journal= {arXiv preprint arXiv:2311.15402},
year = {2023}
}
备注
7 pages, 4 figures, 5 tables