评估孤立大语言模型与多语言大语言模型在希腊语问答中的表现:DemosQA 基准
计算与语言
2026-02-20 v1 人工智能
摘要
近期自然语言处理与深度学习的进展推动了大型语言模型(Large Language Models, LLMs)的发展,显著提升了问答(Question Answering, QA)等众多任务的性能。尽管如此,LLM 研究主要聚焦高资源语言(如英语),仅近期才转向多语言模型。然而,这些模型对少数流行语言存在训练数据偏见,或依赖从高资源语言到低资源语言的迁移学习;这可能导致对社会、文化和历史方面的表述偏差。为此,已开发针对低资源语言的单语 LLM,但其在语言特定任务上的有效性尚未得到充分研究。本研究在希腊语问答领域填补这一研究空白,贡献:(i)DemosQA—a 个新数据集,采用社交媒体用户提问及社区审核答案构建,以更好捕捉希腊语的社会与文化氛围;(ii)可适用于多样化问答数据集与语言的内存高效 LLM 评估框架;(iii)在三种不同提示策略下,对 11 个单语与多语 LLM 在 6 个人工精选希腊语问答数据集上进行广泛评估。我们公开代码与数据以促进可复现性。
引用
@article{arxiv.2602.16811,
title = {Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark},
author = {Charalampos Mastrokostas and Nikolaos Giarelis and Nikos Karacapilidis},
journal= {arXiv preprint arXiv:2602.16811},
year = {2026}
}