剪枝 Wasserstein 指数生成模型与 wigpy 包
机器学习
2021-09-21 v3 计算与语言
综合经济学
经济学
摘要
近期提出的 Wasserstein 指数生成模型(WIG)为自动生成指数指明了新方向。然而,在实践中拟合大型数据集面临两项挑战。首先,Sinkhorn 距离的计算代价闻名地高昂,且严重受维度灾难影响。其次,它需要计算一个完整的 矩阵载入内存,其中 为词表维度。当维度过大时,甚至根本无法计算。为此,我提出一种基于 Lasso 的收缩方法,作为拟合 WIG 模型前的预处理步骤来降低词表维度。在通过 Word2Vec 模型获得词嵌入后,我们可以用 -means 聚类对这些高维向量聚类,并选取每个簇内最频繁的词元构成“基础词表”。非基础词元随后对基础词元向量作回归得到变换权重,从而仅用“基础词元”表示整个词表。这一称为剪枝 WIG(pWIG)的变体,使我们能按需压缩词表维度,同时仍保持高准确度。我还提供了 Python 中的 \textit{wigpy} 模块以两种风格进行计算。文中展示了应用于经济政策不确定性(EPU)指数并与现有时间序列情感指数生成方法的对比。
引用
@article{arxiv.2004.00999,
title = {Pruned Wasserstein Index Generation Model and wigpy Package},
author = {Fangzhou Xie},
journal= {arXiv preprint arXiv:2004.00999},
year = {2021}
}
备注
fix typos and errors