TANDA:迁移并适配预训练 Transformer 模型用于答案句选择
计算与语言
2019-11-21 v2
摘要
我们提出 TANDA,一种用于自然语言任务微调预训练 Transformer 模型的有效技术。具体而言,我们首先通过使用大规模高质量数据集微调,将预训练模型迁移为通用任务模型。然后我们执行第二次微调步骤,将迁移后的模型适配到目标领域。我们展示了该方法在答案句选择中的益处,答案是问答中众所周知的推理任务。我们利用 Natural Questions 数据集构建了支持迁移步骤的大规模数据集。我们的方法在 WikiQA 和 TREC-QA 两个知名基准上确立了最先进水平,分别取得 92% 和 94.3% 的 MAP 分数,大幅优于近期工作中获得的此前最高分 83.4% 和 87.5%。我们经验性地表明 TANDA 生成更稳定、更鲁棒的模型,减少了选择最优超参数的工作量。此外,我们展示 TANDA 的迁移步骤使适配步骤对噪声更鲁棒,从而能够更有效地利用噪声数据集进行微调。最后,我们也在工业环境中使用受不同类型噪声影响的领域特定数据集确认了 TANDA 的积极影响。
引用
@article{arxiv.1911.04118,
title = {TANDA: Transfer and Adapt Pre-Trained Transformer Models for Answer Sentence Selection},
author = {Siddhant Garg and Thuy Vu and Alessandro Moschitti},
journal= {arXiv preprint arXiv:1911.04118},
year = {2019}
}
备注
Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI 2020), Oral Presentation