中文

字符级仅编码器建模的最佳方案是什么

计算与语言 2023-05-10 v1

摘要

本文旨在对近期在字符级输出上下文表示的语义理解模型进展进行基准评测。已有许多此类建模架构及训练这些架构的方法被提出,但目前尚不清楚架构与预训练目标对最终模型性能的相对贡献各占多少。我们探索了此类模型的设计空间,在固定训练流程下,通过比较架构创新与多种不同预训练目标在一套评测任务上的表现,以寻找当前构建和训练类 BERT 的字符级模型的最优方式。我们发现,在相同设置和相同数据下训练,性能最佳的字符级模型超越了基于词元的模型,这表明字符级模型已准备好被更广泛地采用。遗憾的是,训练字符级模型的最佳方法在预训练阶段仍依赖于子词级分词器,且最终模型性能高度依赖于分词器质量。我们相信,我们的结果证明了字符级模型在多语言语言表示方面的就绪性,并鼓励 NLP 从业者将其作为基于词元的模型的即插即用替代品进行尝试。

关键词

引用

@article{arxiv.2305.05461,
  title  = {What is the best recipe for character-level encoder-only modelling?},
  author = {Kris Cao},
  journal= {arXiv preprint arXiv:2305.05461},
  year   = {2023}
}

备注

accepted at ACL 2023