修剪语音对齐提升多语言词表中语音对应模式的推断
计算与语言
2025-12-09 v1
摘要
语音对应模式是历史语言比较中同源词检测和语音重建的基础。已有从语音对齐的同源词集自动推断对应模式的方法,但将其应用于多语言词表需要标注极为完善的数据集。由于标注繁琐且耗时,若能自动改进对齐的同源词数据将十分理想。受进化生物学中通过排除问题位点来改进对齐的修剪技术启发,我们提出了一种在工作流中于对应模式推断之前对比较语言学中的语音对齐进行修剪的方法。在包含来自不同语系的专家标注的十个数据集的大型标准化集合上测试这些技术,我们发现最佳的修剪技术显著提升了对齐的整体一致性。结果显示频繁对应模式的比例以及展现规则同源关系的词的比例均有明显提升。
引用
@article{arxiv.2303.17932,
title = {Trimming Phonetic Alignments Improves the Inference of Sound Correspondence Patterns from Multilingual Wordlists},
author = {Frederic Blum and Johann-Mattis List},
journal= {arXiv preprint arXiv:2303.17932},
year = {2025}
}
备注
The paper was accepted at the SIGTYP workshop 2023 co-located with EACL