面向分组数据的结构化嵌入模型
计算与语言
2017-10-03 v1 机器学习
机器学习
摘要
词嵌入是分析语言的强大方法,而指数族嵌入(EFE)将其扩展到了其他类型的数据。在此,我们开发了结构化指数族嵌入(S-EFE),这是一种用于发现在相关数据组之间变化的嵌入的方法。我们研究了美国国会演讲中的用词如何随州和党派归属而变化,词语在 arXiv 的各部分中用法有何不同,以及杂货的共同购买模式如何随季节变化。我们方法成功的关键在于各组之间共享统计信息。我们开发了两种共享策略:分层建模和摊销。我们在关于演讲、摘要和购物篮的实证研究中展示了该方法的优势。我们展示了 S-EFE 如何实现对用词的特定组别解释,并在预测留出数据方面优于 EFE。
引用
@article{arxiv.1709.10367,
title = {Structured Embedding Models for Grouped Data},
author = {Maja Rudolph and Francisco Ruiz and Susan Athey and David Blei},
journal= {arXiv preprint arXiv:1709.10367},
year = {2017}
}