中文

用于弱监督命名实体识别的稀疏条件隐马尔可夫模型

计算与语言 2022-06-08 v2

摘要

弱监督命名实体识别方法训练标签模型来聚合多个噪声标注函数(LF)的 token 标注,而无需看到任何人工标注标签。为了表现良好,标签模型需要上下文地识别并强调表现良好的 LF,同时降低表现不佳者的权重。然而,由于缺乏真值,评估 LF 具有挑战性。为解决此问题,我们提出稀疏条件隐马尔可夫模型(Sparse-CHMM)。与其他基于 HMM 的方法预测整个发射矩阵不同,Sparse-CHMM 专注于估计其对角元素,这些元素被视为 LF 的可靠性分数。随后稀疏分数通过预定义的扩展函数扩展为完整的发射矩阵。我们还用加权异或分数增强发射,其追踪 LF 观测到错误实体的概率。Sparse-CHMM 通过具有三阶段训练流程的无监督学习进行优化,降低了训练难度并防止模型陷入局部最优。与 Wrench 基准中的基线相比,Sparse-CHMM 在五个综合数据集上实现了 3.01 的平均 F1 分数提升。实验表明 Sparse-CHMM 的每个组件都有效,且估计的 LF 可靠性与真实 LF F1 分数强相关。

关键词

引用

@article{arxiv.2205.14228,
  title  = {Sparse Conditional Hidden Markov Model for Weakly Supervised Named Entity Recognition},
  author = {Yinghao Li and Le Song and Chao Zhang},
  journal= {arXiv preprint arXiv:2205.14228},
  year   = {2022}
}

备注

11 pages, 8 figures, 11 tables