提升 Transformer 在常识推理中的能力
计算与语言
2023-10-11 v1 人工智能
机器学习
摘要
通用预训练语言模型的最新进展在常识推理中展现出巨大潜力。然而,当前工作在包括 Com2Sense 数据集在内的标准常识推理基准上表现仍欠佳。我们认为这源于与当前前沿机器学习方法的脱节。在本工作中,我们旨在通过引入当前基于 ML 的方法以改进通用预训练语言模型在常识推理任务上的表现,从而弥合这一鸿沟。具体而言,我们实验并系统评估了包括知识迁移、模型集成以及引入额外成对对比目标的方法。我们的最佳模型在成对准确率上以约 15% 的绝对增益、在标准准确率上以约 8.7% 的绝对增益超越了此前最强的作品。
引用
@article{arxiv.2310.06803,
title = {Advancing Transformer's Capabilities in Commonsense Reasoning},
author = {Yu Zhou and Yunqiu Han and Hanyu Zhou and Yulun Wu},
journal= {arXiv preprint arXiv:2310.06803},
year = {2023}
}