词嵌入是否真正理解 Loughran-McDonald 的情感极性?
统计金融
2026-05-26 v1 计算金融
摘要
在本文中,我们对 word2vec 模型进行了严格的数学分析,特别是当它配备 Skip-gram 学习方案时。我们的目标是解释如今广泛用于自然语言处理(NLP)的嵌入如何受到所考虑语料库中文档术语分布的影响。我们使用数学公式来阐明,采用此类模型的决策对语言结构做出了隐含假设。我们展示了我们所讨论的马尔可夫假设如何导致对嵌入形成的非常清晰的理论理解,特别是它捕捉我们所称之为频率主义同义词的方式。这些假设使得能够生成生成模型,并对这些 NLP 技术常用损失函数进行显式分析。此外,我们生成了具有不同结构层次的合成语料库,并通过实证展示 word2vec 算法成功或未能学习它们。这使我们能够在一份涵盖 12 年、约 4200 万条金融新闻的语料库上实证评估此类模型捕捉结构的能力。为此,我们依赖广泛用于金融文本的 Loughran-McDonald 情感词表,并表明由于将反义词视为频率主义同义词的处理方式,嵌入容易混淆具有相反极性的术语。此外,我们研究了此类金融语料的非平稳性,令人惊讶的是文献中尚未有记载。我们通过极化词或公司名称组间余弦相似度的时间序列来实现,并表明嵌入确实捕捉了难以分离的英语语义与词语联合分布之混合。
引用
@article{arxiv.2103.09813,
title = {Do Word Embeddings Really Understand Loughran-McDonald's Polarities?},
author = {Mengda Li and Charles-Albert Lehalle},
journal= {arXiv preprint arXiv:2103.09813},
year = {2026}
}
备注
31 pages, 9 figures