中文

基于表情符号表示的资源匮乏语言对比学习

计算与语言 2024-03-08 v1

摘要

社交媒体平台中表情符号(或 emoticon)的引入赋予了用户更强的表达潜力。我们提出了一种称为使用孪生网络架构的表情符号分类(CESNA)的新方法,通过孪生网络将资源匮乏语言与资源丰富语言联合训练,以学习基于表情符号的资源匮乏语言表示。CESNA 模型由共享参数的孪生双向长短期记忆循环神经网络(Bi-LSTM RNN)组成,并通过基于相似性度量的对比损失函数连接。该模型利用基于两种语言句子中存在的表情符号的相似性度量,在共同的表情符号空间中学习资源匮乏语言和资源丰富语言的表示。因此,该模型将具有相似表情符号的句子彼此投影得更接近,而将具有不同表情符号的句子彼此推得更远。在资源丰富语言(英语和西班牙语)与资源匮乏语言(印地语和泰卢固语)的大规模 Twitter 数据集上的实验表明,CESNA 优于基于分布语义、语义规则、词典列表和无可共享参数的深度神经网络表示的最先进表情符号预测方法。

关键词

引用

@article{arxiv.1804.01855,
  title  = {Contrastive Learning of Emoji-based Representations for Resource-Poor Languages},
  author = {Nurendra Choudhary and Rajat Singh and Ishita Bindlish and Manish Shrivastava},
  journal= {arXiv preprint arXiv:1804.01855},
  year   = {2024}
}

备注

Accepted Long Paper at 19th International Conference on Computational Linguistics and Intelligent Text Processing, March 2018, Hanoi, Vietnam. arXiv admin note: substantial text overlap with arXiv:1804.00805