KeNet:用于多标签文本分类的知识增强文档 - 标签注意力网络
计算与语言
2024-03-20 v1
摘要
多标签文本分类(MLTC)是自然语言处理(NLP)领域的一项基础任务,涉及为给定文本分配多个标签。MLTC 已变得至关重要,并广泛应用于主题识别、推荐系统、情感分析和信息检索等多个领域。然而,传统机器学习和深度神经网络尚未解决某些问题,例如部分文档篇幅简短但标签数量众多,以及如何建立标签之间的关系。必须认识到,知识在 MLTC 领域的重要性已得到证实。为解决这一问题,我们提出了一种名为知识增强文档 - 标签注意力网络(KeNet)的新方法。具体而言,我们设计了一种融合外部知识、标签嵌入和综合注意力机制的注意力网络。与传统方法相比,我们利用文档、知识和标签的综合表示来预测单个文本的所有标签。我们的方法已在三个多标签数据集上通过全面研究得到验证。实验结果表明,我们的方法优于最先进的 MLTC 方法。此外,我们还进行了一项案例研究以说明 KeNet 的实际应用。
引用
@article{arxiv.2403.01767,
title = {KeNet:Knowledge-enhanced Doc-Label Attention Network for Multi-label text classification},
author = {Bo Li and Yuyan Chen and Liang Zeng},
journal= {arXiv preprint arXiv:2403.01767},
year = {2024}
}
备注
Accepted in ICASSP 2024