语境的力量:基于随机森林的近同义词分类——现代印地语案例研究
计算与语言
2026-04-03 v1
摘要
同义词是一种广泛而难以理解的语言现象。从理论上讲,绝对同义词不应存在,因为它们不会扩展语言的表达潜能。然而,曾有研究表明,即使同义词指示相同的概念,它们也可能反映不同的视角,或携带不同的文化关联,但此类论点鲜有定量检验。在印地语中,长期的波斯语与波斯-阿拉伯语借词与其梵语对应词共存,形成大量同义词对。本研究探讨了这些借词出现于印度次大陆数百年后,其来源是否仍可仅凭分布式数据加以区分,而不受语义内容的影响。基于印地语同义词词嵌入训练的随机森林分类器成功地按梵语或波斯-阿拉伯语来源对词语进行了分类,即使它们在语义上毫无关联,这表明使用模式仍保留了语源信息。这些发现提供了定量证据,表明语境编码了语源信号,而同义词可能反映与来源相关的细微但系统性区别。它们支持同义词可提供不同视角的观念,以及语源相关的词语可能形成不同的概念子空间,从而塑造一种由历史来源塑造的新型语义框架。总体而言,结果凸显了语境在捕捉传统语义相似性之外的细粒度区别方面的力量。
引用
@article{arxiv.2604.01425,
title = {The power of context: Random Forest classification of near synonyms. A case study in Modern Hindi},
author = {Jacek Bąkowski},
journal= {arXiv preprint arXiv:2604.01425},
year = {2026}
}