词汇吸引与排斥的模型
cmp-lg
2008-02-03 v2 计算与语言
摘要
本文提出基于指数族的新方法,用于建模文本和口语中词语之间的相关性。先前的研究假设词语共现统计效应在数百词的窗口内是恒定的,而我们证明其影响在更小的时间尺度上是非平稳的。来自英文和日文文本以及会话口语的经验数据表明,词语之间的“吸引”呈指数衰减,而风格和句法约束则产生一种“排斥”,阻止词语的紧密共现。我们证明这些特征可以通过基于两阶段指数分布的简单混合模型很好地描述,该模型可以使用EM算法进行训练。由此产生的距离分布随后可以作为惩罚特征纳入指数语言模型中。
引用
@article{arxiv.cmp-lg/9706018,
title = {A Model of Lexical Attraction and Repulsion},
author = {Doug Beeferman and Adam Berger and John Lafferty},
journal= {arXiv preprint arXiv:cmp-lg/9706018},
year = {2008}
}
备注
8 pages, LaTeX source and postscript figures for ACL/EACL'97 paper