中文

ViCGCN:融合上下文语言模型的图卷积网络用于越南语社交媒体挖掘

计算与语言 2023-09-07 v1

摘要

社交媒体处理是自然语言处理中的一项基础任务,具有众多应用。随着越南语社交媒体与信息科学的快速发展,基于越南语社交媒体的信息挖掘变得至关重要。然而,当前最先进的研究面临若干显著缺陷,包括社交媒体平台上的数据不平衡与噪声数据。不平衡与噪声是越南语社交媒体文本中需要解决的两个关键问题。图卷积网络可利用数据的图结构,解决社交媒体文本分类中数据不平衡与噪声的问题。本研究提出一种基于上下文语言模型(PhoBERT)与图方法(图卷积网络)的新方法。具体而言,所提方法 ViCGCN 联合训练上下文嵌入的能力与图卷积网络(GCN)的能力,以捕获更多句法与语义依赖,从而应对上述缺陷。我们在多个越南语基准数据集上进行了大量实验以验证该方法。观察表明,将 GCN 作为 BERTology 模型的最终层可显著提升性能。此外,实验证明 ViCGCN 在三个基准社交媒体数据集上优于 13 个强基线模型,包括 BERTology 模型、BERTology 与 GCN 融合模型、其他基线以及 SOTA。我们提出的 ViCGCN 方法相较最佳上下文语言模型(含多语与单语)在三个基准数据集 UIT-VSMEC、UIT-ViCTSD 和 UIT-VSFC 上分别实现了最高 6.21%、4.61% 和 2.63% 的显著提升。此外,我们的集成模型 ViCGCN 相较于其他与 GCN 集成的 BERTology 模型取得了最佳性能。

关键词

引用

@article{arxiv.2309.02902,
  title  = {ViCGCN: Graph Convolutional Network with Contextualized Language Models for Social Media Mining in Vietnamese},
  author = {Chau-Thang Phan and Quoc-Nam Nguyen and Chi-Thanh Dang and Trong-Hop Do and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2309.02902},
  year   = {2023}
}