中文

利用同词多义引导跨语言数据集构建:语音、具体性与情感性案例

计算与语言 2023-06-06 v1

摘要

同词多义指单一词形被用来表达多个意义的语言现象。通过研究跨语言同词多义,研究者在心理语言学与认知科学等领域获得了有价值的见解 [Jackson et al.,2019]。尽管已存在若干多语言同词多义数据集,但利用该信息在诸如此类语义特征间引导构建数据集的潜力尚未被发掘。本文旨在展示如何借助同词多义创建此类跨语言数据集。我们展示了策展流程,最终得到覆盖全球 21 个语系共 142 种语言的数据集。该数据集包含具体性与情感性评分,并与音素及语音特征相映射。我们进一步沿不同维度分析该数据集,以展示所提流程在促进心理学、认知科学及多语言自然语言处理(NLP)进一步跨学科研究中的潜力。基于初步研究,我们观察到:i) 在具体性/情感性上更接近的同词多义更可能发生同词多义;ii) 某些首/尾音素与具体性/情感性在语系内显著相关,例如突厥语系和壮侗语系中均以 /k/ 作为首音素与具体性相关,达罗毗荼语系和汉藏语系中 /p/ 与效价(Valence)相关;iii) 音素类符形符比(TTR)在多个语系中与具体性正相关,而音素段长度与具体性负相关;iv) 某些语音特征跨语言与具体性负相关。该数据集已在线公开以供进一步研究。

关键词

引用

@article{arxiv.2306.02646,
  title  = {Colexifications for Bootstrapping Cross-lingual Datasets: The Case of Phonology, Concreteness, and Affectiveness},
  author = {Yiyi Chen and Johannes Bjerva},
  journal= {arXiv preprint arXiv:2306.02646},
  year   = {2023}
}

备注

13 pages, 4 figures, accepted to SIGMORPHON 2023