中文

利用新工作流与数据推进跨语言共词化数据库

计算与语言 2025-08-22 v2 数据库

摘要

词汇资源对于跨语言分析至关重要,可以为自然语言学习的计算模型提供新的见解。在此,我们展示了一个用于比较多义词的先进数据库,这种现象被称为共词化。新版本在数据的处理、选择和呈现方面进行了改进。我们将新数据库与先前版本进行了比较,发现我们的改进提供了一个更均衡的样本,涵盖了全球更多的语系,并提升了数据质量,因为所有词形均以音标转写形式提供。我们得出结论,新的跨语言共词化数据库有望启发激动人心的新研究,将跨语言数据与语言类型学、历史语言学、心理语言学和计算语言学中的开放性问题联系起来。

关键词

引用

@article{arxiv.2503.11377,
  title  = {Advancing the Database of Cross-Linguistic Colexifications with New Workflows and Data},
  author = {Annika Tjuka and Robert Forkel and Christoph Rzymski and Johann-Mattis List},
  journal= {arXiv preprint arXiv:2503.11377},
  year   = {2025}
}