中文

西班牙语与英语自然语言生成中的可预测性与因果性

计算与语言 2024-08-27 v1

摘要

近年来,自然语言生成 (NLG) 领域因深度学习技术的最新进展而蓬勃发展。然而,由于主要训练数据集为英语,这些新的数据密集型方法在 NLG 中引入了依赖语言的差异。此外,大多数神经 NLG 系统使用仅解码器(因果)Transformer 语言模型,这类模型在英语上表现良好,但在设计时并未考虑其他语言。在本文中,我们提出一个假设:这些模型可能会在词序较不严格、允许省略主语或具有不同关系从句附着偏好的目标语言中引入生成偏差,因此对于这些目标语言,其他语言生成策略可能更为理想。本文首先比较了英语和西班牙语的因果与非因果语言建模,这两种语言具有不同的语法结构,且分别拥有超过 15 亿和 5 亿使用者。为此,我们定义了一种新颖的平均因果与非因果上下文条件熵指标,用于衡量两种语言的语法类别分布,作为一种信息论的先验方法。对两种语言的自然文本源(如训练数据)的评估表明,西班牙语的平均非因果条件熵较低,而英语的平均因果条件熵较低。根据这一实验,在给定非因果上下文的情况下,西班牙语比英语更具可预测性。然后,通过将条件相对熵指标应用于文本生成实验,我们得出的见解是:英语在因果 NLG 下表现最佳,而西班牙语在非因果 NLG 下表现最佳。这些见解支持了在西班牙语 NLG 中使用双向 Transformer 语言模型的进一步研究。

关键词

引用

@article{arxiv.2408.14283,
  title  = {Predictability and Causality in Spanish and English Natural Language Generation},
  author = {Andrea Busto-Castiñeira and Francisco J. González-Castaño and Silvia García-Méndez and Francisco de Arriba-Pérez},
  journal= {arXiv preprint arXiv:2408.14283},
  year   = {2024}
}