Wasm:构建结构化阿拉伯语交叉多模态语料库的管道
计算与语言
2025-11-11 v1 人工智能
摘要
大语言模型(LLM)和大型多模态模型(LMM)的性能高度依赖其预训练数据集的质量和规模。近期研究表明,在自然文档中进行图像与文本交错处理训练的大型多模态模型,在广泛的基准测试中超越仅使用图像-文本配对训练的模型,能够利用先进的预训练模型实现语义对齐、图像序列一致性和文本连贯性。然而,针对阿拉伯语,缺乏保留文档结构的高质量多模态数据集,限制了该领域的进展。本文提出了用于处理 Common Crawl 数据集的管道 Wasm,以创建新的阿拉伯语多模态数据集,独特地提供 Markdown 输出。不同于现有阿拉伯语语料库仅关注文本提取的做法,我们的方法在保持网页内容结构完整性的同时,兼顾文本模式和多模态预训练场景的灵活性。我们对比分析了数据处理管道与现有主要数据集使用的管道,突出了过滤策略的一致性并阐释了具体设计选择。为支持后续研究,我们公开发布了代表性数据集快照及阿拉伯语多模态处理管道。
引用
@article{arxiv.2511.07080,
title = {Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora},
author = {Khalil Hennara and Ahmad Bastati and Muhammad Hreden and Mohamed Motasim Hamed and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
journal= {arXiv preprint arXiv:2511.07080},
year = {2025}
}