希腊语下的开源或闭源大语言模型?——从希腊语 NLP 实验中获得的启示
计算与语言
2025-01-23 v1 人工智能
机器学习
摘要
针对资源较少的语言的自然语言处理(NLP)面临数据有限、继承高资源语言偏见以及需要领域特定解决方案等持续挑战。本研究针对现代希腊语 addressing these gaps,作了三大贡献:其一,对开源(Llama-70b)和闭源(GPT-4o mini)大语言模型(LLM)在七个核心NLP任务上的表现进行评估,揭示任务特定的优势、劣势及其性能平衡性;其二,将作者身份归因重新定义为评估LLM在预训练中潜在数据用途的工具,高0-shot准确率暗示了数据来源的伦理含义;其三,展示了一个法律NLP案例研究,其中基于摘要、翻译与嵌入(Summarize, Translate, and Embed, STE)的方法在聚类较长法律文本方面优于传统的TF-IDF方法。这些贡献共同为资源较少的语言推进NLP提供了路线图,弥合了模型评估、任务创新和实际影响之间的差距。
引用
@article{arxiv.2501.12826,
title = {Open or Closed LLM for Lesser-Resourced Languages? Lessons from Greek},
author = {John Pavlopoulos and Juli Bakagianni and Kanella Pouli and Maria Gavriilidou},
journal= {arXiv preprint arXiv:2501.12826},
year = {2025}
}
备注
NLP, Modern Greek, benchmark, machine learning, language resources