表情符号预测:扩展与基准测试
计算与语言
2020-07-16 v1
摘要
表情符号是一种简洁的语言形式,能够表达具体含义、情感与意图。表情符号还携带可用于更好理解交际意图的信号。它们已成为我们日常生活中无处不在的一部分,使其成为理解用户生成内容的重要组成。表情符号预测任务旨在预测与一段文本相关联的恰当表情符号集合。通过表情符号预测,模型可学习书面文本交际意图的丰富表示。现有表情符号预测研究聚焦于与特定情感密切相关的少量表情符号类型,该设定过度简化了任务并浪费了表情符号的表现力。本文扩展现有表情符号预测任务设定,纳入更丰富的表情符号集合并允许该任务上的多标签分类。我们提出基于Transformer网络的多类与多标签表情符号预测新模型。我们还利用启发式方法从Twitter构建了多个表情符号预测数据集。在所有设定下的所有数据集上,BERT模型均取得SOTA性能,与先前SOTA相比,准确率相对提升27.21%至236.36%,top-5准确率相对提升2.01%至88.28%,F-1分数相对提升65.19%至346.79%。我们的结果证明了基于深度Transformer的模型在表情符号预测任务上的有效性。我们还在 https://github.com/hikari-NYU/Emoji_Prediction_Datasets_MMS 发布了数据集以供未来研究者使用。
引用
@article{arxiv.2007.07389,
title = {Emoji Prediction: Extensions and Benchmarking},
author = {Weicheng Ma and Ruibo Liu and Lili Wang and Soroush Vosoughi},
journal= {arXiv preprint arXiv:2007.07389},
year = {2020}
}
备注
In Proceedings of the 9th KDD Workshop on Issues of Sentiment Discovery and Opinion Mining (WISDOM 20). San Diego, CA, USA, 7 pages