用于高效准确排序任务的集成 Transformer:在问答系统中的应用
计算与语言
2025-01-03 v2
摘要
大型 transformer 模型可大幅提升答案句选择(AS2)任务性能,但其高计算成本阻碍了在许多实际应用中的使用。本文探讨以下研究问题:如何在不显著增加模型复杂度的前提下提升 AS2 模型的准确性?为此,我们提出一种多头学生架构(命名为 CERBERUS),这是一种用于将大型 transformer 集成模型蒸馏为单一较小模型的高效神经网络。CERBERUS 由两个组件构成:一层用于编码输入的 transformer 层栈,以及一组排序头;与传统蒸馏技术不同,每个排序头通过蒸馏不同的大型 transformer 架构进行训练,以保留集成成员的多样性。所得模型仅使用少量额外参数便捕获了异构 transformer 模型的知识。我们在三个英文 AS2 数据集上展示了 CERBERUS 的有效性;所提方法优于我们所考虑的所有单模型蒸馏,可与参数多 2.7 倍、运行慢 2.5 倍的前沿大型 AS2 模型相媲美。我们的模型代码可在 https://github.com/amazon-research/wqa-cerberus 获取。
引用
@article{arxiv.2201.05767,
title = {Ensemble Transformer for Efficient and Accurate Ranking Tasks: an Application to Question Answering Systems},
author = {Yoshitomo Matsubara and Luca Soldaini and Eric Lind and Alessandro Moschitti},
journal= {arXiv preprint arXiv:2201.05767},
year = {2025}
}
备注
Accepted to EMNLP 2022 as a long paper (Findings). Model code is available at https://github.com/amazon-research/wqa-cerberus