面向印地语-英语代码混合数据的情感识别:一种基于 Transformer 的方法
计算与语言
2021-03-02 v2
摘要
过去几年中,社交媒体文本中的情感检测因其广泛应用于更好地理解消费者、心理学、辅助人机交互、设计智能系统等方面而成为热门问题。由于来自社交媒体的海量数据(常用于表达情绪与观点)可供使用,该问题引起了极大关注。本文我们提出了一个标注了情感检测的 Hinglish 数据集。我们强调了一种基于深度学习的方法,用于检测印地语-英语代码混合推文中的情感,使用源自 FastText 与 Word2Vec 方法的双语词嵌入,以及基于 transformer 的模型。我们尝试了多种深度学习模型,包括 CNN、LSTM、双向 LSTM(含与不含注意力机制),以及诸如 BERT、RoBERTa 和 ALBERT 的 transformer。基于 transformer 的 BERT 模型优于所有其他模型,以 71.43% 的准确率取得最佳性能。
引用
@article{arxiv.2102.09943,
title = {Towards Emotion Recognition in Hindi-English Code-Mixed Data: A Transformer Based Approach},
author = {Anshul Wadhawan and Akshita Aggarwal},
journal= {arXiv preprint arXiv:2102.09943},
year = {2021}
}