中文

面向分组数据的结构化嵌入模型

计算与语言 2017-10-03 v1 机器学习 机器学习

摘要

词嵌入是分析语言的强大方法,而指数族嵌入(EFE)将其扩展到了其他类型的数据。在此,我们开发了结构化指数族嵌入(S-EFE),这是一种用于发现在相关数据组之间变化的嵌入的方法。我们研究了美国国会演讲中的用词如何随州和党派归属而变化,词语在 arXiv 的各部分中用法有何不同,以及杂货的共同购买模式如何随季节变化。我们方法成功的关键在于各组之间共享统计信息。我们开发了两种共享策略:分层建模和摊销。我们在关于演讲、摘要和购物篮的实证研究中展示了该方法的优势。我们展示了 S-EFE 如何实现对用词的特定组别解释,并在预测留出数据方面优于 EFE。

关键词

引用

@article{arxiv.1709.10367,
  title  = {Structured Embedding Models for Grouped Data},
  author = {Maja Rudolph and Francisco Ruiz and Susan Athey and David Blei},
  journal= {arXiv preprint arXiv:1709.10367},
  year   = {2017}
}