中文

面向大规模低资源语言的多任务文本分类:基于图卷积网络的方法

计算与语言 2022-05-04 v1 人工智能 机器学习

摘要

图卷积网络(GCN)在情感分析、情绪检测等单一文本分类任务上已取得最先进的结果。然而,这些性能是通过在英语等资源丰富语言上的测试与报告实现的。将 GCN 应用于多任务文本分类尚属未探索领域。此外,由于数据可用性、丰富的形态变化、句法和语义差异的限制,训练 GCN 或采用英语 GCN 处理印度语言往往受限。在本文中,我们研究了 GCN 在泰卢固语单一与多任务设定下用于四项自然语言处理(NLP)任务的情况,即情感分析(SA)、情绪识别(EI)、仇恨言论检测(HS)和讽刺检测(SAR)。为评估 GCN 在泰卢固语这一印度语言上的表现,我们通过四项下游任务的广泛实验分析了基于 GCN 的模型。此外,我们为这四项 NLP 任务创建了标注泰卢固语数据集 TEL-NLP。进一步,我们提出了一种有监督图重建方法——多任务文本 GCN(MT-Text GCN),在泰卢固语上利用它同时(i)通过图自编码器(GAE)从词-句图重建中学习低维词与句子图嵌入,以及(ii)利用这些潜在句子图嵌入执行多任务文本分类。我们认为,相较于现有的泰卢固语预训练词嵌入以及多语言预训练 Transformer 模型 mBERT 和 XLM-R,我们提出的 MT-Text GCN 在 TEL-NLP 上取得了显著提升。在 TEL-NLP 上,我们在四项 NLP 任务中取得了高 F1 分数:SA(0.84)、EI(0.55)、HS(0.83)和 SAR(0.66)。最后,我们展示了模型在泰卢固语四项 NLP 任务上的定量与定性分析。

关键词

引用

@article{arxiv.2205.01204,
  title  = {Multi-Task Text Classification using Graph Convolutional Networks for Large-Scale Low Resource Language},
  author = {Mounika Marreddy and Subba Reddy Oota and Lakshmi Sireesha Vakada and Venkata Charan Chinni and Radhika Mamidi},
  journal= {arXiv preprint arXiv:2205.01204},
  year   = {2022}
}

备注

9 pages, 6 figures