中文

PhonologyBench:评估大型语言模型的语音学能力

计算与语言 2024-04-08 v2 人工智能 机器学习 声音 音频与语音处理

摘要

语音学是研究语音结构和发音规则的学科,是大型语言模型(LLM)研究中常被忽视的关键组成部分。LLM在各种利用语音学的下游应用中广泛使用,如教育工具和诗歌生成。此外,LLM可能从训练数据中学习到不完美的正字形与语音形式之间的关联。因此,对LLM的语音学能力进行基准测试至关重要。为此,我们提出PhonologyBench,一个新颖的基准测试,包含三个诊断任务,旨在明确测试LLM的语音学能力:音素到音节转换、音节计数和韵律词生成。尽管没有访问语音数据的权限,LLM在PhonologyBench任务上仍表现出色。然而,我们观察到在韵律词生成和音节计数方面,与人类相比分别存在17%和45%的显著差距。我们的发现凸显了研究LLM在语音学任务上的表现的重要性,这些任务会潜在地影响实际应用。此外,我们鼓励研究人员选择在与下游应用密切相关的语音学任务上表现良好的LLM,因为我们发现没有单个模型在所有任务上都一致优于其他模型。

关键词

引用

@article{arxiv.2404.02456,
  title  = {PhonologyBench: Evaluating Phonological Skills of Large Language Models},
  author = {Ashima Suvarna and Harshita Khandelwal and Nanyun Peng},
  journal= {arXiv preprint arXiv:2404.02456},
  year   = {2024}
}

备注

17 pages, 7 figures, 6 tables