中文

学习可能性而后择其优:通过文本游戏解耦语言中的一对多关系

计算与语言 2023-04-27 v2 人工智能 机器学习

摘要

在大规模自监督语料库上预训练语言模型,再进行任务特定微调,已成为自然语言处理(NLP)的主导范式。这些预训练数据集常具有一对多结构——例如在对话中,给定上下文存在许多有效回复。然而,其中只有部分回复在我们下游任务中是可取的。这就提出了应如何训练模型以使其能模拟可取行为而非不可取行为的问题。当前方法在单对单设置下训练——仅对单一对话上下文给出单一目标回复——导致模型仅学习预测平均回复,而忽略了全部可能回复的范围。我们以文本游戏为测试平台,提出 PASA 方法,利用离散潜变量捕捉较大预训练数据集中所代表的不同行为范围。随后我们使用知识蒸馏将后验概率分布蒸馏至学生模型。该概率分布远比仅从数据集的硬目标中学习更为丰富,从而使 student 模型能从 teacher 模型学到的更丰富动作范围中获益。结果显示,在 Jericho Walkthroughs 数据集上相较先前最先进模型取得了最高 49% 的经验性提升。

关键词

引用

@article{arxiv.2304.07258,
  title  = {Learn What Is Possible, Then Choose What Is Best: Disentangling One-To-Many Relations in Language Through Text-based Games},
  author = {Benjamin Towle and Ke Zhou},
  journal= {arXiv preprint arXiv:2304.07258},
  year   = {2023}
}

备注

EMNLP Findings 2022