中文

通过自监督图预训练释放表情符号在文本中的力量

计算与语言 2024-09-27 v2 人工智能

摘要

表情符号在社交平台上获得了巨大的流行度,常作为补充或取代文本的常见手段。然而,现有的数据挖掘方法要么完全忽略表情符号,要么仅将其视为普通 Unicode 字符,这可能限制模型把握表情符号中丰富语义信息以及表情符号与文本之间相互作用的能力。因此,有必要释放表情符号在社交媒体数据挖掘中的潜力。为此,我们首先构建由三类节点组成的异构图,即帖子、单词和表情符号节点,以提高对帖子中不同元素的表示。边也被恰当地定义,以建模这些元素之间的相互作用。为促进帖子、单词和表情符号节点之间的信息共享,我们提出了用于文本和表情符号共模型的图预训练框架,其中包含两个图预训练任务:节点级图对比学习和边级链接重建学习。在针对 Xiaohongshu 和 Twitter 数据集进行大量实验后,两种下游任务的结果表明,我们的方法相对于以往强基准方法具有显著的改进。

关键词

引用

@article{arxiv.2409.14552,
  title  = {Unleashing the Power of Emojis in Texts via Self-supervised Graph Pre-Training},
  author = {Zhou Zhang and Dongzeng Tan and Jiaan Wang and Yilong Chen and Jiarong Xu},
  journal= {arXiv preprint arXiv:2409.14552},
  year   = {2024}
}

备注

Accepted by EMNLP 2024 Main Conference