中文

ÚFAL 在 MultiLexNorm 2021:通过微调 ByT5 改进多语言词汇规范化

计算与语言 2021-11-18 v2

摘要

我们呈现 W-NUT 2021 多语言词汇规范化(MultiLexNorm)共享任务(van der Goot et al., 2021a)的获胜方案,该任务在 11 种语言的 12 个社交媒体数据集上评测词汇规范化系统。我们的方案基于预训练的字节级语言模型 ByT5(Xue et al., 2021a),我们进一步在合成数据上预训练,然后在真实规范化数据上微调。我们的系统在内在评测中以大幅优势取得最佳性能,并通过依存句法分析的外在评测中也取得最佳性能。源代码发布于 https://github.com/ufal/multilexnorm2021,微调模型发布于 https://huggingface.co/ufal。

关键词

引用

@article{arxiv.2110.15248,
  title  = {\'UFAL at MultiLexNorm 2021: Improving Multilingual Lexical Normalization by Fine-tuning ByT5},
  author = {David Samuel and Milan Straka},
  journal= {arXiv preprint arXiv:2110.15248},
  year   = {2021}
}

备注

Accepted to W-NUT 2021