通过建模潜在词内结构实现字级中文依存句法分析
计算与语言
2024-06-07 v1
摘要
由于缺乏明确的词边界,揭示中文句子的句法结构对词级解析器构成了重大挑战。为了促进从词级到字级中文依存句法分析的转变,本文提出对词内的潜在内部结构进行建模。通过这种方式,每个词级依存树被解释为字级树的森林。实现了一种受约束的Eisner算法以确保字级树的兼容性,保证词内结构具有单一根节点,并在这些根节点之间建立词间依存关系。在中文树库上的实验表明,我们的方法优于流水线框架和之前的联合模型。详细分析表明,由粗到细的解析策略使模型能够预测更具语言学合理性的词内结构。
引用
@article{arxiv.2406.03772,
title = {Character-Level Chinese Dependency Parsing via Modeling Latent Intra-Word Structure},
author = {Yang Hou and Zhenghua Li},
journal= {arXiv preprint arXiv:2406.03772},
year = {2024}
}
备注
Findings of ACL 2024