从因果视角在多层标签文本分类中准确利用标签依赖
计算与语言
2023-10-12 v1 人工智能
机器学习
摘要
多层标签文本分类(MLTC)旨在为给定文本分配最相关的标签。现有方法表明标签依赖可帮助提升模型性能。然而,引入标签依赖可能导致模型遭受非预期的预测偏差。在本研究中,我们将该偏差归因于模型对标签依赖的误用,即模型倾向于利用标签依赖中的相关性捷径,而非融合文本信息与标签依赖进行预测。受因果推断启发,我们提出反事实文本分类器(CFTC)以消除相关性偏差,并做出基于因果的预测。具体而言,我们的 CFTC 首先采用先预测后修正的骨干网络提取标签依赖中嵌入的精确标签信息,随后借助人工因果图通过反事实去偏技术阻断相关性捷径。在三个数据集上的实验结果表明,我们的 CFTC 显著优于基线方法,并有效消除了数据集中的相关性偏差。
引用
@article{arxiv.2310.07588,
title = {Accurate Use of Label Dependency in Multi-Label Text Classification Through the Lens of Causality},
author = {Caoyun Fan and Wenqing Chen and Jidong Tian and Yitian Li and Hao He and Yaohui Jin},
journal= {arXiv preprint arXiv:2310.07588},
year = {2023}
}
备注
Applied Intelligence 2023