Multi-TW:在台湾传统中文问答基准测试中评估多模态模型
人工智能
2025-08-05 v1 计算与语言
摘要
多模态大语言模型(MLLM)处理视觉、声学和文本输入,解决了单模态大语言模型的局限性。然而,现有基准常常忽略传统中文的三模态评估,且不考虑推理延迟。为此,我们引入Multi-TW,即首个针对任何到任何多模态模型进行性能和延迟评估的传统中文基准测试。Multi-TW包含900个多选问答题(图像与文本、音频与文本配对),来源于由面向素质测试指导委员会(SC-TOP)开发的官方素质测试。我们评估了各种任何到任何模型和视觉语言模型(VLM),并加入音频转录。结果显示,闭源模型在各模态上普遍优于开源模型,尽管开源模型在音频任务中表现良好。端到端的任何到任何管道相对于使用独立音频转录的VLM,具有明显的延迟优势。Multi-TW提供了模型能力的全面视图,并凸显了传统中文微调和高效多模态架构的必要性。
引用
@article{arxiv.2508.01274,
title = {Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan},
author = {Jui-Ming Yao and Bing-Cheng Xie and Sheng-Wei Peng and Hao-Yuan Chen and He-Rong Zheng and Bing-Jia Tan and Peter Shaojui Wang and Shun-Feng Su},
journal= {arXiv preprint arXiv:2508.01274},
year = {2025}
}