DuwatBench:通过面向多模态理解的阿拉伯书法基准桥接语言与视觉遗产
计算机视觉与模式识别
2026-01-28 v1
摘要
阿拉伯书法代表了阿拉伯语最丰富的视觉传统之一,将语言意义与艺术形式融为一体。尽管多模态模型在各种语言上取得了进展,但它们处理阿拉伯语脚本的能力,尤其是在艺术和风格化的书法形式中,在很大程度上仍未被探索。为了填补这一空白,我们提出了 DuwatBench,这是一个包含 1,272 个精选样本的基准,涵盖六种古典和现代书法风格中的约 1,475 个独特单词,每个样本均配有句子级别的检测标注。该数据集反映了阿拉伯语书写中的现实挑战,如标准文本识别系统通常难以处理的复杂笔画模式、密集连字和风格变化。使用 DuwatBench,我们评估了 13 个领先的阿拉伯语和多语言多模态模型,结果表明,尽管它们在干净文本上表现良好,但在处理书法变体、艺术失真和精确的视觉-文本对齐方面存在困难。通过公开发布 DuwatBench 及其标注,我们旨在推进具有文化根基的多模态研究,促进阿拉伯语言和视觉遗产在 AI 系统中的公平包容,并支持该领域的持续进展。我们的数据集 (https://huggingface.co/datasets/MBZUAI/DuwatBench) 和评估套件 (https://github.com/mbzuai-oryx/DuwatBench) 已公开发布。
引用
@article{arxiv.2601.19898,
title = {DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding},
author = {Shubham Patle and Sara Ghaboura and Hania Tariq and Mohammad Usman Khan and Omkar Thawakar and Rao Muhammad Anwer and Salman Khan},
journal= {arXiv preprint arXiv:2601.19898},
year = {2026}
}
备注
Accepted to EACL-2026 (Main Track)