GlobalTrait:多语言词嵌入的人格对齐
计算与语言
2018-11-21 v2
摘要
我们提出了一种多语言模型,用于从英语、西班牙语、荷兰语和意大利语四种不同语言的文本数据中识别大五人格特质。我们的分析表明,在不同语言中语义相似词并不一定对应相同的人格特质。因此,我们提出了一种人格对齐方法GlobalTrait,它对每种特质提供从源语言到目标语言(英语)的映射,使得与每种特质正相关的词在多语言向量空间中彼此接近。使用这些对齐的嵌入进行训练,我们可以将英语等高资源语言中人格相关的训练特征迁移到其他低资源语言,并获得优于简单单语言和对齐前多语言嵌入的多语言结果。与采用单语言模型相比,使用CNN及人格对齐嵌入的多语言模型使平均F值(除英语外的所有三种语言)从65提升至73.4(+8.4)。我们还在回归任务中展示了相对良好的性能,并在独立的中文数据集上评估时获得了更好的分类结果。
引用
@article{arxiv.1811.00240,
title = {GlobalTrait: Personality Alignment of Multilingual Word Embeddings},
author = {Farhad Bin Siddique and Dario Bertero and Pascale Fung},
journal= {arXiv preprint arXiv:1811.00240},
year = {2018}
}
备注
Submitted and accepted to AAAI 2019 conference