面向瑞典相关事实知识的诊断性基准
计算与语言
2026-03-03 v2
摘要
许多瑞典相关基准是美国中心基准的翻译版本,因此不适用于测试与瑞典特别相关甚至特定的知识。我们因此引入了一个手动编写的问答基准,专门针对瑞典相关人物与事件进行构建,其中许多在国际媒体中获得的覆盖范围非常有限。我们的标注者从一个热门的电台节目中获得灵感,该节目涉及来自文化和媒体的公众人物以及瑞典的重大体育赛事。该数据集可用于衡量不同规模模型以及瑞典覆盖程度在瑞典相关事实记忆方面的表现,并允许探测跨语言事实一致性,因为它包含英文翻译。使用该数据集,我们发现许多小型模型在瑞典相关事实的记忆方面,表现相当于规模为三个倍的多语言模型。我们还观察到,对瑞典语言的继续预训练通常会提高事实知识,但会导致先前已知信息的部分遗忘。这些结果表明,该数据集作为诊断工具,对于研究在语言适应期间多语言模型的语言适应和知识保留具有潜力。
引用
@article{arxiv.2510.21360,
title = {A Diagnostic Benchmark for Sweden-Related Factual Knowledge},
author = {Jenny Kunz},
journal= {arXiv preprint arXiv:2510.21360},
year = {2026}
}
备注
To appear at LREC 2026