中文

提升 Transformer 在常识推理中的能力

计算与语言 2023-10-11 v1 人工智能 机器学习

摘要

通用预训练语言模型的最新进展在常识推理中展现出巨大潜力。然而,当前工作在包括 Com2Sense 数据集在内的标准常识推理基准上表现仍欠佳。我们认为这源于与当前前沿机器学习方法的脱节。在本工作中,我们旨在通过引入当前基于 ML 的方法以改进通用预训练语言模型在常识推理任务上的表现,从而弥合这一鸿沟。具体而言,我们实验并系统评估了包括知识迁移、模型集成以及引入额外成对对比目标的方法。我们的最佳模型在成对准确率上以约 15% 的绝对增益、在标准准确率上以约 8.7% 的绝对增益超越了此前最强的作品。

关键词

引用

@article{arxiv.2310.06803,
  title  = {Advancing Transformer's Capabilities in Commonsense Reasoning},
  author = {Yu Zhou and Yunqiu Han and Hanyu Zhou and Yulun Wu},
  journal= {arXiv preprint arXiv:2310.06803},
  year   = {2023}
}