基于真实生活变体数据的卢森堡语神经文本规范化
计算与语言
2024-12-16 v2
摘要
因缺乏完整标准变体,卢森堡语文本中正字法变体非常常见。此外,由于正在进行的标准化进程,开发卢森堡语的 NLP工具也面临数据稀缺和缺乏标注平行数据的挑战。本文提出了首个使用 ByT5 和 mT5 架构的序列到序列规范化模型,其训练数据来源于词级真实生活变体数据。我们进行细粒度、以语言学为导向的评估,以测试基于字节、基于词和基于管道的模型在文本规范化中的优势与弱点。我们表明,使用真实生活变体数据的序列模型是卢森堡语定制化规范化的有效方法。
引用
@article{arxiv.2412.09383,
title = {Neural Text Normalization for Luxembourgish using Real-Life Variation Data},
author = {Anne-Marie Lutgen and Alistair Plum and Christoph Purschke and Barbara Plank},
journal= {arXiv preprint arXiv:2412.09383},
year = {2024}
}
备注
Accepted at VarDial 2025