面向台湾的传统中文视觉语言模型基准测试VisTW
计算机视觉与模式识别
2025-03-14 v1 机器学习
摘要
本文提出了面向传统中文的视觉语言模型(VLM)全面评估基准测试。我们的评估套组包括两个互补组件:(1)VisTW-MCQ,来自21个学术科目的手动精选考试多选题集合,用于测试VLMs的广泛知识和推理能力;(2)VisTW-Dialogue,一个开放式对话基准测试,包含131对人工创建的图像-问题配对,用于评估VLMs在台湾文化语境下进行自由形式对话生成的能力。这些基准测试填补了评估格局中严重的空白,即现有基准测试主要关注英文或简体中文,忽视了台湾和港澳等地区使用的独特语言和文化方面的特点。我们的分析揭示了 various VLMs之间存在显著的性能差异,并突出了处理传统中文视觉内容面临的具体挑战。
引用
@article{arxiv.2503.10426,
title = {Improving Medical Waste Classification with Hybrid Capsule Networks},
author = {Bennet van den Broek and Javad Pourmostafa Roshan Sharami},
journal= {arXiv preprint arXiv:2503.10426},
year = {2025}
}