波兰语文本历时标准化的两种方法
计算与语言
2024-02-05 v1
摘要
本文讨论了波兰语文本历时标准化的两种方法:一种基于规则的解决方案,依赖于一组手工编制的模式;以及一种基于文本到文本迁移Transformer架构的神经标准化模型。本文详细讨论了为该任务准备的训练和评估数据,以及为比较所提出的标准化解决方案而进行的实验。文中进行了定量和定性分析。结果表明,在当前对该问题的研究阶段,基于规则的解决方案在准备的数据集的4个变体中的3个上优于神经模型,尽管在实践中两种方法各有明显的优缺点。
引用
@article{arxiv.2402.01300,
title = {Two Approaches to Diachronic Normalization of Polish Texts},
author = {Kacper Dudzic and Filip Graliński and Krzysztof Jassem and Marek Kubis and Piotr Wierzchoń},
journal= {arXiv preprint arXiv:2402.01300},
year = {2024}
}
备注
Accepted to the LaTeCH-CLfL 2024 workshop