衡量多模态模型在乌克兰语语言理解方面:跨学术与文化领域的基准测试
计算与语言
2024-11-25 v1
摘要
尽管多模态英语中心模型的评估是活跃的研究领域,已有诸多基准测试,但对于低资源和中等资源语言却缺乏基准测试或评估套件。我们引入 ZNO-Vision,一个源自标准化大学入学考试 (ZNO) 的综合性乌克兰语中心基准测试。该基准测试包含超过 4,300 个专家精心设计的题目,涵盖 12 个学科领域,包括数学、物理、化学和人文科学。我们评估了开源模型和 API 提供商的性能,发现只有少数模型超过基线。随着新的基准测试,我们进行了乌克兰语多模态文本生成的首次评估研究:我们测量了在 Multi30K-UK 数据集上的标题生成质量,将 VQA 基准测试翻译成乌克兰语,并测量其相对于原始英文版本的性能下降。最后,我们从文化角度测试了几款模型在国家美食知识方面的表现。我们相信我们的工作将推动乌克兰语多模态生成能力的发展,我们的方法也对其他低资源语言有所帮助。
引用
@article{arxiv.2411.14647,
title = {Benchmarking Multimodal Models for Ukrainian Language Understanding Across Academic and Cultural Domains},
author = {Yurii Paniv and Artur Kiulian and Dmytro Chaplynskyi and Mykola Khandoga and Anton Polishko and Tetiana Bas and Guillermo Gabrielli},
journal= {arXiv preprint arXiv:2411.14647},
year = {2024}
}