中文

利用词向量与集成模型预测并理解立法

计算与语言 2017-07-05 v2 物理与社会 应用统计 机器学习

摘要

在 2001 年至 2015 年间美国国会提出的近 70,000 项法案中,仅有 2,513 项最终成为法律。我们开发了一种机器学习方法,用于预测任何法案成为法律的概率。从 2001 年第 107 届国会开始,我们使用往届国会的数据训练模型,预测当届国会的所有法案,并重复此过程直至以第 113 届国会作为测试集。在预测中,我们利用语言模型对法案的每个句子进行评分,该模型将立法词汇嵌入到一个高维、富含语义的向量空间中。这种语言表示使我们能够探究对于任何议题,哪些词语会增加法案通过的概率。为检验文本与上下文信息的相对重要性,我们将文本模型与仅使用上下文信息的模型(例如,使用法案发起人是否属于多数党等变量)进行了比较。为检验法案提出后的修改对我们预测其最终结果能力的影响,我们比较了使用提出时可获得的法案文本和元数据与使用最新数据的效果。在法案提出时,仅基于上下文的预测优于仅基于文本的预测;而使用最新数据时,仅基于文本的预测则优于仅基于上下文的预测。将文本与上下文信息结合始终表现最佳。我们对组合模型进行了全局敏感性分析,以确定预测法案通过的重要变量。

关键词

引用

@article{arxiv.1607.02109,
  title  = {Predicting and Understanding Law-Making with Word Vectors and an Ensemble Model},
  author = {John J. Nay},
  journal= {arXiv preprint arXiv:1607.02109},
  year   = {2017}
}