AutoArabic:用于本地化视频-文本检索基准的三阶段框架
计算机视觉与模式识别
2025-09-23 v1 计算与语言
摘要
视频到文本和文本到视频检索领域由英文基准(如 DiDeMo、MSR-VTT)和近期的多语种语料库(如 RUDDER)主导,然而阿拉伯语仍未得到充分服务,缺乏本地化的评估指标。我们引入了一个三阶段框架 AutoArabic,利用最先进的大型语言模型(LLM)将非阿拉伯语基准翻译为现代标准阿拉伯语,将所需的人工修订减少了近四倍。该框架包含一个错误检测模块,能以 97% 的准确率自动标记潜在的翻译错误。将该框架应用于视频检索基准 DiDeMo,生成了 DiDeMo-AR,这是一个包含 40,144 条流畅阿拉伯语描述的阿拉伯语变体。我们提供了对翻译错误的分析,并将其组织成有启发性的分类体系,以指导未来的阿拉伯语本地化工作。我们在该基准的阿拉伯语和英语变体上,以相同的超参数训练了一个 CLIP 风格的基线模型,发现存在中等程度的性能差距(在 Recall@1 上约 3 个百分点),表明阿拉伯语本地化保留了基准的难度。我们评估了三种后期编辑预算(零预算/仅标记/全部),发现性能随着后期编辑的增加而单调提升,同时原始 LLM 输出(零预算)仍然可用。为确保对其他语言的可复现性,我们在 https://github.com/Tahaalshatiri/AutoArabic 开放了代码。
关键词
引用
@article{arxiv.2509.16438,
title = {AutoArabic: A Three-Stage Framework for Localizing Video-Text Retrieval Benchmarks},
author = {Mohamed Eltahir and Osamah Sarraj and Abdulrahman Alfrihidi and Taha Alshatiri and Mohammed Khurd and Mohammed Bremoo and Tanveer Hussain},
journal= {arXiv preprint arXiv:2509.16438},
year = {2025}
}
备注
Accepted at ArabicNLP 2025 (EMNLP 2025 workshop)