中文

用于少样本机器涌现通信预训练

计算与语言 2024-02-16 v1 人工智能 机器学习

摘要

尽管依赖大规模多语言预训练编码器的前沿模型在下游应用中实现了样本效率,它们仍需要大量无标注文本。然而,世界上大多数语言缺乏此类资源。因此,我们在无语言数据的情况下研究一种更激进的无监督知识迁移形式。特别地,我们首次通过指称游戏中的涌现通信来预训练神经网络。我们的关键假设是,将通信基于图像——作为对真实世界环境的粗略近似——会以归纳方式偏置模型去学习自然语言。一方面,我们展示这在少样本设定下大幅裨益机器翻译。另一方面,这也提供了一种外在评估协议,用以在试管外探查涌现语言的属性。直观上,它们越接近自然语言,从其预训练获得的增益应越高。例如,本工作中我们度量了通信成功率和最大序列长度对下游性能的影响。最后,我们引入了定制适配器层以及微调期间最大后验推断正则化的退火策略。这些被证明对促进知识迁移和防止灾难性遗忘至关重要。相较于循环基线,我们的方法在仅500500个NMT训练样本时取得BLEU分数59.0%59.0\%\sim147.6%147.6\%的提升,在1,0001,000个NMT训练样本时跨四种语言对取得65.1%65.1\%\sim196.7%196.7\%的提升。这些概念验证结果揭示了涌现通信预训练对于资源匮乏设定下自然语言处理任务及人工语言外在评估的潜力。

关键词

引用

@article{arxiv.2011.00890,
  title  = {Emergent Communication Pretraining for Few-Shot Machine Translation},
  author = {Yaoyiran Li and Edoardo M. Ponti and Ivan Vulić and Anna Korhonen},
  journal= {arXiv preprint arXiv:2011.00890},
  year   = {2024}
}