中文

IndicBART:一种面向印度语言自然语言生成的预训练模型

计算与语言 2022-10-28 v2 人工智能

摘要

本文研究面向一组相关语言的预训练序列到序列模型,重点关注印度语言。我们提出IndicBART,一个专注于11种印度语言与英语的多语言序列到序列预训练模型。IndicBART利用印度文字之间的正字法相似性来改进相似印度语言间的迁移学习。我们在两个NLG任务上评估IndicBART:神经机器翻译 (NMT) 与极端摘要。我们在NMT与极端摘要上的实验表明,尽管规模显著更小,像IndicBART这样针对相关语言的模型仍可与mBART50等大型预训练模型竞争。它也在语言未参与预训练或微调的极低资源翻译场景中表现良好。文字共享、多语言训练以及对有限模型容量的更好利用促成了紧凑型IndicBART模型的良好表现。

关键词

引用

@article{arxiv.2109.02903,
  title  = {IndicBART: A Pre-trained Model for Indic Natural Language Generation},
  author = {Raj Dabre and Himani Shrotriya and Anoop Kunchukuttan and Ratish Puduppully and Mitesh M. Khapra and Pratyush Kumar},
  journal= {arXiv preprint arXiv:2109.02903},
  year   = {2022}
}

备注

Published at ACL 2022, 15 pages