少即是多:一种轻量且鲁棒的语篇解析神经架构
计算与语言
2023-09-11 v2
摘要
复杂的特征提取器被广泛用于构建文本表示。然而,这些复杂的特征提取器使得自然语言处理系统易于过拟合,尤其是在下游训练数据集相对较小时,这正是若干语篇解析任务所面临的情况。因此,我们提出了一种替代性的轻量神经架构,该架构去除了多个复杂特征提取器,仅利用可学习的自注意力模块来间接利用预训练神经语言模型,以最大程度保留预训练语言模型的泛化能力。在三个常见语篇解析任务上的实验表明,在近期预训练语言模型的驱动下,仅由两层自注意力组成的轻量架构获得了更好的泛化能力与鲁棒性。同时,它以更少的可学习参数和更短的处理时间取得了相当甚至更优的系统性能。
引用
@article{arxiv.2210.09537,
title = {Less is More: A Lightweight and Robust Neural Architecture for Discourse Parsing},
author = {Ming Li and Ruihong Huang},
journal= {arXiv preprint arXiv:2210.09537},
year = {2023}
}