SinFoS:用于翻译斯林acha语言俗语的平行数据集
计算与语言
2026-02-11 v1
摘要
俗语(Figures of Speech, FoS)由多词短语构成,这些短语与文化紧密交织。虽然神经机器翻译(Neural Machine Translation, NMT)在高资源语言的修辞表达方面表现相对良好,但在数据有限的低资源语言如斯林acha语言时常面临挑战。为此,我们引入了一个包含2344个斯林acha语言俗语且带有文化和跨语言注释的数据集。我们检查了该数据集,以对俗语的文化来源进行分类,并识别其跨语言等价形式。此外,我们开发了一个二分类器来区分数据集中两种类型的俗语,准确率约为92%。我们还评估了现有大型语言模型在该数据集上的表现。我们的发现揭示了当前大型语言模型能力的显著不足,因为这些模型常常难以准确传达习语意义。通过公开此数据集,我们为未来的低资源NLP研究和文化感知机器翻译提供了一个关键基准。
引用
@article{arxiv.2602.09866,
title = {SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech},
author = {Johan Sofalas and Dilushri Pavithra and Nevidu Jayatilleke and Ruvan Weerasinghe},
journal= {arXiv preprint arXiv:2602.09866},
year = {2026}
}
备注
19 pages, 6 figures, 8 tables, Accepted paper at the 22nd Workshop on Multiword Expressions (MWE 2026) @ EACL 2026