中文

词嵌入中情感信息的表征

计算与语言 2022-09-23 v1

摘要

自然语言处理(NLP)与自然语言理解(NLU)领域日益增长的研究正在探究从大语言模型中学习或编码于词嵌入中的类人知识。这是迈向理解语言模型所捕获的、与人类对语言和交际的理解相似的知识的一步。在此,我们研究了词的情感意义(即效价、唤醒度、支配度)是否以及如何在大型神经网络预训练的词嵌入中被编码。我们使用人工标注的数据集作为真值,并对四类词嵌入进行了多种相关性与分类测试。这些嵌入在静态或上下文相关,以及在预训练与微调阶段情感特定信息的优先程度方面有所不同。我们的分析表明,原始 BERT 模型的词嵌入并未显著编码英语词的情感信息。只有当 BERT 模型在情感相关任务上微调或包含来自情感丰富上下文的额外上下文信息时,相应嵌入才能编码更多相关情感信息。

关键词

引用

@article{arxiv.2209.10583,
  title  = {Representing Affect Information in Word Embeddings},
  author = {Yuhan Zhang and Wenqi Chen and Ruihan Zhang and Xiajie Zhang},
  journal= {arXiv preprint arXiv:2209.10583},
  year   = {2022}
}