铸造GEMs:通过质量导向语料库策展推动希腊语NLP发展
计算与语言
2025-10-27 v2 人工智能
摘要
语言学处理技术在处理形态复杂且资源有限的语言(如现代希腊语)时,受限于架构停滞、数据稀缺以及在专业领域(如法律领域)的上下文处理能力有限。为此,我们提出了希腊语嵌入模型(Greek Embedding Models,简称GEMs),这是一套新的基于Transformer的语言模型,通过架构多样性和增强的数据策展来解决上述局限。该模型系列在多个大规模、精心策展的语料库上进行训练,涵盖全面且通用的通用领域数据集以及专业的法律语料库,旨在解决希腊语语言模型发展受限于数据稀缺的持续问题。我们提出的质量导向语料库策展方法包含广泛的预处理流程、精细的去重策略以及针对性地重复高质量法律子语料库以增强领域适应性。GEMs系列包括已建立的架构(RoBERTa和Longformer),以及尚未应用于希腊语的先进模型(ELECTRA、ConvBERT和ModernBERT),为覆盖现代Transformer设计提供了全面的范围。此外,我们引入了首个为跨语言法律应用量身定制的双语希腊语-英语嵌入模型。通过对三个核心自然语言理解基准进行全面评估,证明所提出的GEM-RoBERTa和GEM-ConvBERT在多个评估指标上均显著优于现有最先进模型,准确率提升最高可达3.6%。我们采用Friedman Aligned-Ranks和Finner后验检验等统计分析方法,确认了我们方法在多个评估指标上的优越性。
引用
@article{arxiv.2510.20002,
title = {Forging GEMs: Advancing Greek NLP through Quality-Based Corpus Curation},
author = {Alexandra Apostolopoulou and Konstantinos Kanaris and Athanasios Koursaris and Dimitris Tsakalidis and George Domalis and Ioannis E. Livieris},
journal= {arXiv preprint arXiv:2510.20002},
year = {2025}
}
备注
The manuscript is submitted to Applied Sciences