中文

以风格变异为视角看待语码转换

计算与语言 2020-05-04 v1

摘要

语码转换(CS)是在若干双语和多语社群中观察到的常见现象,因而在数字和社交媒体平台上日益普遍。这种日益增长的显著性要求对 CS 语言进行建模以服务于关键的下游任务。该领域的一个主要问题是缺乏标注数据和用于训练大规模神经模型的大量语料。生成海量高质量文本有助于多个严重依赖语言建模的下游任务,如语音识别、文本到语音合成等。我们提出了一种看待 CS 的新视角,将其视为参与双方语言之间的风格变异。我们的方法不需要任何外部标注(如词汇语言标识)。它主要依赖于易于获取的单语语料(无需任何平行对齐)和有限的一组自然 CS 句子。我们提出了一种两阶段生成对抗训练方法:第一阶段生成有竞争力的 CS 负例,第二阶段生成更真实的 CS 句子。我们在以下语言对上展示了实验:西班牙语-英语、普通话-英语、印地语-英语和阿拉伯语-法语。我们表明,通过双阶段训练过程,所生成 CS 的各项指标趋势在上述每一语言对中均更接近真实 CS 数据。我们认为这种将 CS 视为风格变异的观点为建模 CS 文本中的各类任务开辟了新视角。

关键词

引用

@article{arxiv.2005.00458,
  title  = {Style Variation as a Vantage Point for Code-Switching},
  author = {Khyathi Raghavi Chandu and Alan W Black},
  journal= {arXiv preprint arXiv:2005.00458},
  year   = {2020}
}