HTCInfoMax:基于信息最大化的层次文本分类全局模型
计算与语言
2021-04-13 v1 机器学习
摘要
当前层次文本分类的最优模型 HiAGM 有两个局限。首先,它将每个文本样本与数据集中的所有标签相关联,其中包含不相关信息。其次,它未考虑结构编码器所学标签表示的任何统计约束,而先前工作已证明表示学习的约束是有益的。本文中,我们提出 HTCInfoMax,通过引入信息最大化来解决这些问题,其包括两个模块:文本-标签互信息最大化和标签先验匹配。第一个模块可显式建模每个文本样本与其真实标签之间的交互,从而过滤掉不相关信息。第二个模块鼓励结构编码器学习具有期望特性的更好标签表示,从而能更好处理层次文本分类中的标签不平衡。在两个基准数据集上的实验结果证明了所提 HTCInfoMax 的有效性。
引用
@article{arxiv.2104.05220,
title = {HTCInfoMax: A Global Model for Hierarchical Text Classification via Information Maximization},
author = {Zhongfen Deng and Hao Peng and Dongxiao He and Jianxin Li and Philip S. Yu},
journal= {arXiv preprint arXiv:2104.05220},
year = {2021}
}
备注
Accepted by NAACL-HLT 2021