中文

生成式语言模型在哪些语言中最为正式?跨语言形式化分布分析

计算与语言 2023-02-27 v1

摘要

多语言生成式语言模型(LMs)在大量语言中日益流畅。它们在多种语言语料库的拼接上训练,能够实现从高资源语言到低资源语言的有力迁移。然而,这些模型的预测中引入了何种文化偏见仍属未知。在本文中,我们关注一种深受文化影响的语言属性:形式性。我们分析了两个流行的生成式多语言语言模型 XGLM 和 BLOOM 在 5 种语言中的预测的形式性分布。我们将每种语言 1,200 条生成文本分类为正式、非正式或不连贯,并衡量提示形式性对预测的影响。总体而言,我们观察到跨模型和语言的行为多样性。例如,当以非正式提示作条件时,XGLM 在阿拉伯语和孟加拉语中生成的非正式文本远多于 BLOOM。此外,尽管两个模型在中性提示下都高度偏向正式风格,我们发现即使以正式文本提示,模型仍生成了相当数量的非正式预测。我们随本文发布了 6,000 条标注样本,为未来关于生成式多语言 LMs 形式性的工作铺平道路。

关键词

引用

@article{arxiv.2302.12299,
  title  = {In What Languages are Generative Language Models the Most Formal? Analyzing Formality Distribution across Languages},
  author = {Asım Ersoy and Gerson Vizcarra and Tasmiah Tahsin Mayeesha and Benjamin Muller},
  journal= {arXiv preprint arXiv:2302.12299},
  year   = {2023}
}

备注

17 pages