中文

方化英文词:一种生成字形以将超字符用于情感分析的方法

计算与语言 2019-07-17 v2

摘要

超字符(Super Characters)方法通过首先将输入文本转换为图像,然后应用 2D-CNN 模型对情感进行分类来解决情感分析问题。它在许多基准数据集上取得了最先进的性能。然而,在拉丁语系语言中它不如在亚洲语言中直接易用。因为 2D-CNN 模型设计用于识别二维图像,若输入为字形形式则更佳。在本文中,我们提出 SEW(方化英文词,Squared English Word)方法,通过在字母层面绘制每个英文词的超字符图像来生成每个英文词的方化字形,在句子层面将方化字形组合为整张超字符图像,然后应用 CNN 模型对句内情感进行分类。我们将 SEW 方法应用于 Wikipedia 数据集,相较于原始超字符方法获得了 2.1% 的准确率提升。对于同时具有结构化表格数据和非结构化自然语言文本的多模态数据,改进后的 SEW 方法将数据整合为单张图像并用一个统一的 CNN 模型分类情感。

关键词

引用

@article{arxiv.1902.02160,
  title  = {Squared English Word: A Method of Generating Glyph to Use Super Characters for Sentiment Analysis},
  author = {Baohua Sun and Lin Yang and Catherine Chi and Wenhan Zhang and Michael Lin},
  journal= {arXiv preprint arXiv:1902.02160},
  year   = {2019}
}