众包 Piedmontese 语言以测试 LLM 在非标准拼写下的表现
计算与语言
2026-02-17 v1
摘要
我们 presented 一个众包的 Piedmontese 语言数据集,这是一种来自意大利西北部的濒危罗曼语。该数据集包含 145 句意大利语-Piedmontese 平行句,来自 Flores+,翻译由说话者以其自然的拼写风格撰写,而非遵循标准惯例,同时包括手动对齐。我们使用该资源对大语言模型在分词一致性、主题分类和机器翻译方面进行基准测试。我们的分析显示,Piedmontese 相对于高资源罗曼语语言在分词上存在惩罚,但 LLM 在分类任务上 Achieved 接近意大利语、法语和英语的性能。机器翻译结果呈现不对称性:模型能够从 Piedmontese 翻译到高资源语言,但生成 Piedmontese 仍然具有挑战性。该数据集和代码已公开发布。
关键词
引用
@article{arxiv.2602.14675,
title = {Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography},
author = {Gianluca Vico and Jindřich Libovický},
journal= {arXiv preprint arXiv:2602.14675},
year = {2026}
}
备注
17 pages, 6 figures, at VarDial20226