阿迪斯塔古叙事问答基准:阿迪斯塔古语多文化叙事问答基准
计算与语言
2026-02-04 v1
摘要
随着大语言模型多语言和文化评估基准的日益关注,语言和文化常被视为等价,性能常被用作模型理解给定语言的代理指标。在本工作中,我们认为此类评估忽略了单个语言内存在的有意义的文化差异。我们通过聚焦于埃塞俄比亚不同地区的叙事来弥补这一差距,证明尽管具有共享的语言特征,地区特定和领域特定内容对语言评估结果产生实质性影响。为此,我们引入\textbf{\textit{AmharicStoryQA}},一个以阿迪斯塔古语不同地区的文化多样性叙事为基础的长序列叙事问答基准。通过该基准,我们揭示了现有大型语言模型在叙事理解方面的显著差距,突出了评估结果中的显著地区差异,并显示监督式微调在不同地区和评估情景下的不均衡改进。我们的发现强调了超越语言层面评估以更准确地评估和改进低资源语言叙事理解能力的文化基础化基准的必要性。
引用
@article{arxiv.2602.02774,
title = {AmharicStoryQA: A Multicultural Story Question Answering Benchmark in Amharic},
author = {Israel Abebe Azime and Abenezer Kebede Angamo and Hana Mekonen Tamiru and Dagnachew Mekonnen Marilign and Philipp Slusallek and Seid Muhie Yimam and Dietrich Klakow},
journal= {arXiv preprint arXiv:2602.02774},
year = {2026}
}