中文

中低资源语言巴赫尔斯语词汇化句法树解析:低资源训练与跨域泛化

计算与语言 2026-01-13 v1

摘要

近年来,越来越多地关注应用神经网络和上下文感知词嵌入来解析历史语言。然而,大多数进展都集中在依存语法解析方面,而针对中低资源历史语言如中古荷兰语的句法树解析获得了很少的关注。在本文中,我们将基于Transformer的句法树解析器适用于中古荷兰语,这是一种高度异构且资源有限的语言,並探讨提高其领域内和跨域性能的方法。我们表明,与更高资源辅助语言联合训练可提高F1分数最高0.73分,最大提升来自与中古荷兰语在地理和时间上更接近的语言。我们进一步评估了利用来自额外领域的新标注数据的方法,发现微调和数据组合均可获得可 comparable的提升,我们的神经网络解析器持续优于目前用于中古荷兰语的PCFG-based解析器。我们进一步探索了用于领域适应的特征分离技术,证明大约需要200个样本的最小阈值才能有效提升跨域性能。

关键词

引用

@article{arxiv.2601.07008,
  title  = {Lexicalized Constituency Parsing for Middle Dutch: Low-resource Training and Cross-Domain Generalization},
  author = {Yiming Liang and Fang Zhao},
  journal= {arXiv preprint arXiv:2601.07008},
  year   = {2026}
}