中文

理解输入词符字符在语言模型中的作用:信息损失如何影响性能?

计算与语言 2023-10-27 v1

摘要

理解预训练语言模型(PLMs)如何以及学到了语言的哪些内容,是自然语言处理中的一个开放挑战。先前的工作集中于识别它们是否捕获了语义和句法信息,以及数据或预训练目标如何影响其性能。然而,据我们所知,此前尚无研究专门考察输入词符字符中的信息损失如何影响 PLM 的性能。在本研究中,我们通过使用来自单个词符的极小字符子集预训练语言模型来弥补这一空白。令人惊讶的是,我们发现即使在极端设置下预训练——即每个词符仅使用一个字符——在标准 NLU 基准测试和探测任务中相对于全词符模型的性能保持率仍然很高。例如,仅基于词符的首个字符预训练的模型,在 SuperGLUE 和 GLUE 任务中分别达到了全词符模型约 90%90\%77%77\% 的性能保持率。

关键词

引用

@article{arxiv.2310.17271,
  title  = {Understanding the Role of Input Token Characters in Language Models: How Does Information Loss Affect Performance?},
  author = {Ahmed Alajrami and Katerina Margatina and Nikolaos Aletras},
  journal= {arXiv preprint arXiv:2310.17271},
  year   = {2023}
}

备注

To appear at EMNLP 2023