一种基于语义的表情符号相似度度量
计算与语言
2017-07-18 v1 社会与信息网络
摘要
表情符号已发展成为网络上最重要的交流形式之一。随着其广泛使用,度量表情符号相似度已成为当代文本处理的一个重要问题,因为它处于情感分析、搜索和界面设计任务的核心。本文通过对EmojiNet知识库中机器可读的表情符号含义学习的嵌入模型,对表情符号的语义相似度进行了全面分析。利用表情符号描述、表情符号义项标签和义项定义,以及从Twitter和Google News获得的不同训练语料库,我们开发并测试了多种嵌入模型来度量表情符号相似度。为评估我们的工作,我们创建了一个称为EmoSim508的新数据集,它为一组精心挑选的508个表情符号对分配了人工标注的语义相似度分数。经EmoSim508验证后,我们使用情感分析任务展示了我们的表情符号嵌入模型的一个真实用例,并表明我们的模型在该任务上优于先前性能最佳的表情符号嵌入模型。EmoSim508数据集和我们的表情符号嵌入模型随本文公开发布,可从 http://emojinet.knoesis.org/ 下载。
引用
@article{arxiv.1707.04653,
title = {A Semantics-Based Measure of Emoji Similarity},
author = {Sanjaya Wijeratne and Lakshika Balasuriya and Amit Sheth and Derek Doran},
journal= {arXiv preprint arXiv:1707.04653},
year = {2017}
}
备注
This paper is accepted at Web Intelligence 2017 as a full paper, In 2017 IEEE/WIC/ACM International Conference on Web Intelligence (WI). Leipzig, Germany: ACM, 2017