基于 Transformer 的吠陀梵语历时分析:量化语言变化类型的神经方法
计算与语言
2025-12-08 v1
摘要
本研究展示了混合神经符号方法如何为一个形态丰富、资源匮乏的语言的演化提供显著的新见解。我们挑战了语言变化即简化的朴素假设,通过定量分析超过 2000 年的梵语,展示了弱监督混合方法如何为形态丰富、资源匮乏语言的演化提供新见解。我们的方法通过弱监督解决了数据稀缺问题,使用 100 多个高精度正则表达式模式为多语言 BERT 的微调生成伪标签。然后我们通过一种新颖的置信度加权集成融合符号和神经输出,创建了一个既可扩展又可解释的系统。将此框架应用于包含 147 万词的历时语料库,我们的集成实现了 52.4% 的总体特征检测率。我们的发现表明梵语的整体形态复杂性并未降低,而是被动态重新分配:虽然早期动词特征呈现周期性衰退模式,但复杂性转移到其他领域,表现为复合的显著扩展和新哲学术语的出现。关键的是,我们的系统产生了良好校准的不确定性估计,置信度与准确率高度相关(Pearson r = 0.92),整体校准误差较低(ECE = 0.043),增强了这些计算语言学发现的可信度。
引用
@article{arxiv.2512.05364,
title = {Transformer-Enabled Diachronic Analysis of Vedic Sanskrit: Neural Methods for Quantifying Types of Language Change},
author = {Ananth Hariharan and David Mortensen},
journal= {arXiv preprint arXiv:2512.05364},
year = {2025}
}