概率上下文无关文法距离的计算
形式语言与自动机理论
2014-07-08 v1
摘要
概率上下文无关文法(PCFGs)用于定义字符串上的分布,是自然语言处理、软件工程、模型检测、生物信息学和模式识别等多个领域的强大建模工具。一个常见且重要的问题是比较由这些文法生成或建模的分布:这通过检查语言等价性和计算距离来实现。如果每个字符串在两个文法中具有相同的概率,则这两个 PCFG 是语言等价的。这也意味着距离(无论使用何种范数)为零。已知上下文无关文法的语言等价性问题与多重歧义性问题可相互归约,而后者是一个长期存在的开放问题。在本工作中,我们证明计算距离对应于求解不可判定问题:对于 L1 范数、L2 范数、变分距离和 Kullback-Leibler 散度均属于这种情况。另外两个结果则不那么消极:1. 可以计算出最可能的字符串;2. Chebyshev 距离(即两个分布之间在所有字符串上的最大概率差)与语言等价性问题可相互归约。
引用
@article{arxiv.1407.1513,
title = {On the Computation of Distances for Probabilistic Context-Free Grammars},
author = {Colin de la Higuera and James Scicluna and Mark-Jan Nederhof},
journal= {arXiv preprint arXiv:1407.1513},
year = {2014}
}
备注
12 pages