你脑中何物?多任务 Transformer 模型中的涌现行为
计算与语言
2021-09-07 v2
摘要
自然语言处理中多任务训练的主要范式是用共享的预训练语言模型表示输入,并为每个任务添加一个小型、轻量的网络(头)。给定输入,目标头是被选用于输出最终预测的头。在本工作中,我们考察非目标头的行为,即头在给定属于与其训练任务不同的任务的输入时的输出。我们发现非目标头表现出涌现行为,其可能解释目标任务,或泛化到其原始任务之外。例如,在一个数值推理任务中,一个跨度抽取头从输入中抽取出计算的参数,该计算产生由目标生成头生成的数字。此外,一个与目标问答头一同训练的摘要头,在给定问题和需从中抽取答案的上下文时,输出基于查询的摘要。这种涌现行为表明,多任务训练导致了技能的非平凡外推,可被用于可解释性与泛化。
引用
@article{arxiv.2104.06129,
title = {What's in your Head? Emergent Behaviour in Multi-Task Transformer Models},
author = {Mor Geva and Uri Katz and Aviv Ben-Arie and Jonathan Berant},
journal= {arXiv preprint arXiv:2104.06129},
year = {2021}
}
备注
EMNLP 2021