开放世界中的领域增量终身学习
计算与语言
2023-05-12 v1 人工智能
机器学习
摘要
终身学习(LL)是 NLP 模型持续学习新任务的重要能力。基于架构的方法被报道为 LL 模型的有效实现。然而,将先前方法扩展到领域增量 LL 场景并非易事,因为它们要么在测试阶段需要访问任务标识,要么无法处理来自未见任务的样本。在本文中,我们提出 \textbf{Diana}:一种基于\underline{动}\underline{态}\underline{架}\underline{构}的终身\underline{学}\underline{习}模型,试图通过提示增强的语言模型学习一系列任务。Diana 中使用四类分层组织的提示从不同粒度捕获知识。具体而言,我们专设任务级提示以捕获任务特定知识以保持高 LL 性能,并维护实例级提示以学习跨输入样本共享的知识以提升模型泛化性能。此外,我们专设独立提示显式建模未见任务,并引入一组提示键向量以促进任务间知识共享。大量实验表明 Diana 优于最先进的 LL 模型,尤其在处理未见任务方面。我们在 \url{https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/diana} 发布代码与数据。
引用
@article{arxiv.2305.06555,
title = {Domain Incremental Lifelong Learning in an Open World},
author = {Yi Dai and Hao Lang and Yinhe Zheng and Bowen Yu and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2305.06555},
year = {2023}
}
备注
ACL2023 Findings Long Paper. arXiv admin note: substantial text overlap with arXiv:2208.14602