俄语语言架构的多模态评估
计算与语言
2026-01-27 v3 人工智能
计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)目前处于研究关注焦点,规模和能力正在快速发展,但其智力、局限性和风险仍不充分地被理解。为此,尤其是在俄语语境下(目前尚无多模态基准测试),我们引入了MERA Multi——一个面向俄语语言架构的开放式多模态评估框架。该基准基于指令,涵盖默认文本、图像、音频和视频等模态,包含18个新构建的评估任务,适用于通用模型和特定模态架构(图像到文本、视频到文本和音频到文本)。我们的贡献包括:(i)多模态能力的通用分类学;(ii)完全从零构建的18个数据集,注重俄语文化和语言特色,统一提示词和指标;(iii)封闭源和开源模型的基线结果;(iv)防止基准泄漏的方法,包括私密集合的水印技术。虽然当前主要聚焦于俄语,但本基准提供了面向类型多样性语言(特别是斯拉夫语族)构建多模态基准的可复制方法。
引用
@article{arxiv.2511.15552,
title = {Multimodal Evaluation of Russian-language Architectures},
author = {Artem Chervyakov and Ulyana Isaeva and Anton Emelyanov and Artem Safin and Maria Tikhonova and Alexander Kharitonov and Yulia Lyakh and Petr Surovtsev and Denis Shevelev and Vildan Saburov and Vasily Konovalov and Elisei Rykov and Ivan Sviridov and Amina Miftakhova and Ilseyar Alimova and Alexander Panchenko and Alexander Kapitanov and Alena Fenogenova},
journal= {arXiv preprint arXiv:2511.15552},
year = {2026}
}
备注
EACL main track