中文

通过建模潜在词内结构实现字级中文依存句法分析

计算与语言 2024-06-07 v1

摘要

由于缺乏明确的词边界,揭示中文句子的句法结构对词级解析器构成了重大挑战。为了促进从词级到字级中文依存句法分析的转变,本文提出对词内的潜在内部结构进行建模。通过这种方式,每个词级依存树被解释为字级树的森林。实现了一种受约束的Eisner算法以确保字级树的兼容性,保证词内结构具有单一根节点,并在这些根节点之间建立词间依存关系。在中文树库上的实验表明,我们的方法优于流水线框架和之前的联合模型。详细分析表明,由粗到细的解析策略使模型能够预测更具语言学合理性的词内结构。

关键词

引用

@article{arxiv.2406.03772,
  title  = {Character-Level Chinese Dependency Parsing via Modeling Latent Intra-Word Structure},
  author = {Yang Hou and Zhenghua Li},
  journal= {arXiv preprint arXiv:2406.03772},
  year   = {2024}
}

备注

Findings of ACL 2024