示例编程遇上历史语言学:一种基于大语言模型的语音定律归纳方法
计算与语言
2025-01-29 v1
摘要
历史语言学家长期以来一直在编写“程序”,通过有序的字符串重写函数(称为语音定律)将祖先语言中的重建词转换为其有证后代词。然而,编写这些程序非常耗时,这促使了自动语音定律归纳(SLI)的发展,我们在本文中将其表述为利用大语言模型(LLM)的示例编程(PBE)。尽管 LLM 在代码生成方面已被证明有效,但最近的工作表明 PBE 具有挑战性,但可以通过微调来改进,特别是当使用与评估数据来自相同分布的训练数据时。在本文中,我们创建了一个概念框架以界定何为 SLI 的“相似分布”,并提出了四种具有不同数量归纳偏置的合成数据生成方法,以研究什么能带来最佳性能。基于这些结果,我们创建了一个作为 PBE 的 SLI 的 SOTA 开源模型(通过率为+6%,参数量仅为次优 LLM 的三分之一),并强调了 PBE 研究令人兴奋的未来方向。
引用
@article{arxiv.2501.16524,
title = {Programming by Examples Meets Historical Linguistics: A Large Language Model Based Approach to Sound Law Induction},
author = {Atharva Naik and Darsh Agrawal and Hong Sng and Clayton Marr and Kexun Zhang and Nathaniel R Robinson and Kalvin Chang and Rebecca Byrnes and Aravind Mysore and Carolyn Rose and David R Mortensen},
journal= {arXiv preprint arXiv:2501.16524},
year = {2025}
}