中文

基于统一文本到文本迁移 Transformer 的极端多领域多任务学习

计算与语言 2022-09-22 v1 机器学习

摘要

文本到文本 Transformer 在多任务迁移学习的任务中展现了显著的成功,尤其是在自然语言处理(NLP)中。然而,尽管已有若干尝试在不同领域上训练 Transformer,这些领域之间通常存在明确的关系,例如代码摘要,其中自然语言摘要描述了代码。极少有研究探讨多任务迁移学习在显著不同领域的任务上如何运作。在本项目中,我们研究了使用多领域文本到文本迁移 Transformer(MD-T5)在两个领域——Python 代码与国际象棋——上的四个任务进行多领域多任务学习的行为。我们使用三种流行的训练策略进行了大量实验:Bert 风格联合预训练 + 顺序微调、GPT 风格联合预训练 + 顺序微调,以及 GPT 风格联合预训练 + 联合微调。此外,我们在四项指标上评估模型——对弈得分(Play Score)、评估得分(Eval Score)、BLEU 得分(BLEU Score)和多领域学习得分(MDLS)。这些指标衡量了跨各种任务及多领域学习的性能。我们表明,尽管负知识迁移与灾难性遗忘对所有模型仍是相当大的挑战,GPT 风格联合预训练 + 联合微调策略在多领域多任务学习中展现出最大潜力,因为它在全部四个任务上表现良好,同时仍保持其多领域知识。

关键词

引用

@article{arxiv.2209.10106,
  title  = {Extreme Multi-Domain, Multi-Task Learning With Unified Text-to-Text Transfer Transformers},
  author = {Adebayo Oshingbesan and Courage Ekoh and Germann Atakpa and Yonah Byaruagaba},
  journal= {arXiv preprint arXiv:2209.10106},
  year   = {2022}
}