IPA-CHILDES 与 G2P+: 面向跨语言语音与语音学语言建模的特征丰富资源
计算与语言
2025-06-13 v3
摘要
本文介绍了两个资源:(i) G2P+,一个用于将正字法数据集转换为一致语音表示的工具; (ii) IPA CHILDES,一个覆盖 31 种语言的儿童中心化语音语音数据集。先前的 grapheme-to-phoneme 转换工具导致语音词汇表与 established 语音表示库不一致,这一问题由 G2P+ 通过利用 Phoible 数据库中的表示库来解决。使用该工具,我们将 CHILDES 补充语音转录,以产生 IPA CHILDES。这个新资源填补了现有语音数据集中的若干空白,这些数据集常常缺乏多语言覆盖、非自发语音以及对儿童定向语言的关注。我们通过在 11 种语言上训练语音语言模型并对其进行特征探测,展示了该数据集的实用性,发现语音的分布属性足以在跨语言层面学习主要类别和位置特征。
引用
@article{arxiv.2504.03036,
title = {IPA-CHILDES & G2P+: Feature-Rich Resources for Cross-Lingual Phonology and Phonemic Language Modeling},
author = {Zébulon Goriely and Paula Buttery},
journal= {arXiv preprint arXiv:2504.03036},
year = {2025}
}
备注
Accepted to CoNLL 2025