基于多源信息探索和双层对比学习提升短文本分类性能
计算与语言
2025-01-17 v1
摘要
短文本分类作为自然语言处理中的一个研究子主题,由于在实际场景中存在语义稀疏和标签样本不足的问题,具有更大的挑战性。我们在本工作中提出了一种名为MI-DELIGHT的新型模型。具体而言,该模型首先进行多源信息(即统计信息、语言信息和事实信息)的探索,以缓解稀疏性问题。随后,采用图学习方法对短文本进行表征,其以图形式呈现。此外,我们引入双层(即实例层和簇层)对比学习辅助任务,以有效捕获大量无标签数据中不同粒度的对比信息。同时,先前模型仅在平行中执行主任务和辅助任务,未考虑任务之间的关系。因此,我们引入分层架构来显式建模任务之间的相关性。在 various基准数据集上进行大量实验,表明MI-DELIGHT显著优于先前的竞争模型,甚至在几个数据集上超越了流行的大型语言模型。
关键词
引用
@article{arxiv.2501.09214,
title = {Boosting Short Text Classification with Multi-Source Information Exploration and Dual-Level Contrastive Learning},
author = {Yonghao Liu and Mengyu Li and Wei Pang and Fausto Giunchiglia and Lan Huang and Xiaoyue Feng and Renchu Guan},
journal= {arXiv preprint arXiv:2501.09214},
year = {2025}
}
备注
AAAI2025