中文

迈向增量式 Transformer:面向增量自然语言理解的 Transformer 模型实证分析

计算与语言 2024-05-03 v2

摘要

增量处理使交互式系统能够基于部分输入作出响应,这是对话智能体等场景所期望的特性。当前流行的 Transformer 架构本质上将序列作为整体处理,抽象掉了时间概念。近期工作尝试通过重启增量性将 Transformer 增量应用:反复将越来越长的输入前缀送入未改变的模型以产生部分输出。然而,该方法计算代价高,且对长序列无法高效扩展。与此同时,我们见证了使 Transformer 更高效的努力,例如带循环机制的 Linear Transformer(LT)。本文中,我们考察 LT 用于英语增量 NLU 的可行性。结果表明,与标准 Transformer 及采用重启增量性的 LT 相比,循环 LT 模型具有更好的增量性能和更快的推理速度,代价是部分非增量(全序列)质量下降。我们展示,通过训练模型在提交输出前等待右向上下文,可缓解性能下降,且使用输入前缀训练有益于给出正确的部分输出。

关键词

引用

@article{arxiv.2109.07364,
  title  = {Towards Incremental Transformers: An Empirical Analysis of Transformer Models for Incremental NLU},
  author = {Patrick Kahardipraja and Brielen Madureira and David Schlangen},
  journal= {arXiv preprint arXiv:2109.07364},
  year   = {2024}
}

备注

Accepted at EMNLP 2021 (contains corrigendum)