中文

序列数据上基于模式的 CRF 的推断算法

机器学习 2017-01-23 v5 数据结构与算法

摘要

我们考虑定义在链上的具有基于模式势的条件随机场(CRFs)。在该模型中,字符串(标记)x1...xnx_1...x_n 的能量是区间 [i,j][i,j] 上各项之和,其中仅当子串 xi...xjx_i...x_j 等于预指定模式 α\alpha 时,各项才非零。此类 CRF 可自然地应用于许多序列标注问题。我们提出了用于 CRF 中三个标准推断任务的高效算法,即计算 (i) 配分函数,(ii) 边缘概率,以及 (iii) 计算最大后验概率(MAP)。它们的复杂度分别为 O(nL)O(n L)O(nLmax)O(n L \ell_{max})O(nLmin{D,log(max+1)})O(n L \min\{|D|,\log (\ell_{max}+1)\}),其中 LL 是输入模式的总长度,max\ell_{max} 是模式的最大长度,DD 是输入字母表。这改进了 (Ye et al., 2009) 先前的算法,其复杂度分别为 O(nLD)O(n L |D|)O(nΓL2max2)O(n |\Gamma| L^2 \ell_{max}^2)O(nLD)O(n L |D|),其中 Γ|\Gamma| 是输入模式的数量。此外,我们给出了一种用于采样的高效算法。最后,我们考虑了非正权重的情况。(Komodakis & Paragios, 2009) 给出了一种用于计算 MAP 的 O(nL)O(n L) 算法。我们提出了一种修改方案,其具有相同的最坏情况复杂度,但在最佳情况下表现更优。

关键词

引用

@article{arxiv.1210.0508,
  title  = {Inference algorithms for pattern-based CRFs on sequence data},
  author = {Rustem Takhanov and Vladimir Kolmogorov},
  journal= {arXiv preprint arXiv:1210.0508},
  year   = {2017}
}

备注

Algorithmica accepted version