中文

训练与约束:基于主题与释义的语音学绕口令生成

计算与语言 2024-10-21 v3

摘要

以往基于语音学和语音学基础的语言生成工作主要集中在双关语和诗歌等领域。在本文中,我们提出了关于英语绕口令生成的新工作——这是一种要求在音素级别进行条件化以最大化声音重叠,同时保持与输入主题或短语的语义一致性,并且语法正确的语言形式。我们提出了 TwisterLister,一个利用大型语言模型 (LLMs) 生成具有语音学信息的绕口令的流水线,我们用它生成了 TwistList 2.0,这是迄今为止最大的带标注绕口令数据集,包含来自人类和 LLM 作者的 17K+ 个样本。我们的生成流水线涉及使用受语音学约束的词汇表以及 LLM 提示,以生成新颖、非衍生性的绕口令样本。我们还展示了在生成的数据集上训练的较小模型的自动评估和人工评估结果,以证明在没有显式注入语音学知识的情况下,能在多大程度上生成受语音学动机驱动的语言类型。此外,我们引入了一个音素感知的约束解码模块 (PACD),该模块可集成到自回归语言模型中,并证明该方法在微调和不微调底层语言模型的情况下均能生成高质量的绕口令。我们还设计并实现了一系列用于绕口令生成任务的自动评估指标,这些指标受语音学动机驱动,并捕捉了绕口令的独特本质,主要基于音素编辑距离 (PED)。

关键词

引用

@article{arxiv.2403.13901,
  title  = {Train & Constrain: Phonologically Informed Tongue-Twister Generation from Topics and Paraphrases},
  author = {Tyler Loakman and Chen Tang and Chenghua Lin},
  journal= {arXiv preprint arXiv:2403.13901},
  year   = {2024}
}

备注

Accepted Final Version to Computational Linguistics