用于开放域问答可扩展推理的解耦 Transformer
计算与语言
2021-08-06 v1
摘要
大型 transformer 模型(如 BERT)在开放域问答(QA)的机器阅读理解(MRC)中取得了最先进(state-of-the-art)结果。然而,transformer 的推理计算成本高,难以应用于语音助手等在线 QA 系统。为降低计算成本与延迟,我们提出将 transformer MRC 模型解耦为输入组件与交叉组件。该解耦使得部分表示计算可离线执行并缓存供在线使用。为保持解耦 transformer 的精度,我们设计了源自标准 transformer 模型的知识蒸馏目标。此外,我们引入了可学习的表示压缩层,将缓存的存储需求降低四倍。在 SQUAD 2.0 数据集上的实验中,解耦 transformer 将开放域 MRC 的计算成本与延迟降低了 30-40%,且相比标准 transformer 仅差 1.2 个 F1 分数点。
关键词
引用
@article{arxiv.2108.02765,
title = {Decoupled Transformer for Scalable Inference in Open-domain Question Answering},
author = {Haytham ElFadeel and Stan Peshterliev},
journal= {arXiv preprint arXiv:2108.02765},
year = {2021}
}
备注
RANLP 2021