发现形式—意义关联中特定概念的偏向性
计算与语言
2021-04-30 v2
摘要
本工作提出了跨语言非任意性的信息论操作化方法。词的形式与意义之间存在微小的跨语言关联并非新观点。例如,曾有主张(Blasi 等,2016)认为“tongue”(舌)一词包含音素 [l] 的概率高于随机水平。通过在一个非常大的概念对齐跨语言词典中控制语系和地理邻近性的影响,我们将先前用于检测语言内非任意性(Pimentel 等,2019)的方法扩展至度量跨语言关联。我们发现非任意性存在显著效应,但正如预期其效应很小(根据我们的信息论估计平均小于 0.5%)。我们还提供了概念层面的分析,显示本工作中考虑的概念中有四分之一表现出显著的跨语言非任意性。总之,本文提供了在大规模上检测跨语言关联的新方法,并确认其效应是微小的。
引用
@article{arxiv.2104.06325,
title = {Finding Concept-specific Biases in Form--Meaning Associations},
author = {Tiago Pimentel and Brian Roark and Søren Wichmann and Ryan Cotterell and Damián Blasi},
journal= {arXiv preprint arXiv:2104.06325},
year = {2021}
}
备注
Accepted at NAACL 2021. This is the camera ready version. Code is available in https://github.com/rycolab/form-meaning-associations