ÚFAL 在 MultiLexNorm 2021:通过微调 ByT5 改进多语言词汇规范化
计算与语言
2021-11-18 v2
摘要
我们呈现 W-NUT 2021 多语言词汇规范化(MultiLexNorm)共享任务(van der Goot et al., 2021a)的获胜方案,该任务在 11 种语言的 12 个社交媒体数据集上评测词汇规范化系统。我们的方案基于预训练的字节级语言模型 ByT5(Xue et al., 2021a),我们进一步在合成数据上预训练,然后在真实规范化数据上微调。我们的系统在内在评测中以大幅优势取得最佳性能,并通过依存句法分析的外在评测中也取得最佳性能。源代码发布于 https://github.com/ufal/multilexnorm2021,微调模型发布于 https://huggingface.co/ufal。
引用
@article{arxiv.2110.15248,
title = {\'UFAL at MultiLexNorm 2021: Improving Multilingual Lexical Normalization by Fine-tuning ByT5},
author = {David Samuel and Milan Straka},
journal= {arXiv preprint arXiv:2110.15248},
year = {2021}
}
备注
Accepted to W-NUT 2021