LEIA:用于情感识别的语言嵌入模型
计算与语言
2023-04-24 v1 人工智能
计算机与社会
机器学习
摘要
社交媒体产生的海量文本数据使得利用语言模型对情感进行新型分析成为可能。这些模型通常在由读者猜测社交媒体帖子中他人所表达情感的小型且昂贵的人工标注文本数据集上训练。由于训练数据规模限制以及模型开发中所用标签产生过程的噪声,这影响了情感识别方法的质量。我们提出 LEIA,一种用于文本情感识别的模型,其在包含超过 600 万条带有自我标注情感标签(快乐、喜爱、悲伤、愤怒和恐惧)的帖子数据集上训练。LEIA 基于一种词掩码方法,在模型预训练过程中增强对情感词的学习。LEIA 在三个领域内测试数据集上取得了约 73 的宏 F1 值,在一个强基准上优于其他有监督和无监督方法,该基准表明 LEIA 可跨帖子、用户和时间段泛化。我们进一步在五个来自社交媒体和其他来源的不同数据集上进行域外评估,展示了 LEIA 跨媒体、数据收集方法和标注方案的稳健性能。我们的结果表明,LEIA 将其对愤怒、快乐和悲伤的分类泛化到了其训练领域之外。LEIA 可应用于未来研究中,从作者视角提供更好的文本情感识别。本文所产出的模型已在 https://huggingface.co/LEIA 公开可用。
引用
@article{arxiv.2304.10973,
title = {LEIA: Linguistic Embeddings for the Identification of Affect},
author = {Segun Taofeek Aroyehun and Lukas Malik and Hannah Metzler and Nikolas Haimerl and Anna Di Natale and David Garcia},
journal= {arXiv preprint arXiv:2304.10973},
year = {2023}
}