面向多语言网页搜索的MARCA基准测试
计算机视觉与模式识别
2026-04-17 v1 人工智能
摘要
大型语言模型(LLMs)正日益被用作信息来源,但其可靠性取决于能够检索网页、选择相关证据并综合完整答案的能力。虽然最近的基准测试评估了网页浏览和代理式工具使用,但多语言环境,特别是葡萄牙语,仍处于未被充分探索的地位。我们提出了\textsc{MARCA},一个双语(英语和葡萄牙语)基准,用于评估LLMs在基于网页的信息寻求任务中的表现。\textsc{MARCA}由52个手动编写的多实体问题组成,配有手动验证的清单式评分标准,显式衡量答案的完整性和正确性。我们在两种交互设置下评估了14个模型:Basic框架采用直接网页搜索和抓取,Orchestrator框架通过委托子代理实现任务分解。为捕捉随机性,对每个问题执行多次,报告具有运行水平不确定性的性能。在所有模型中,观察到显著的性能差异,发现编排通常会提高覆盖率,并识别出模型在英语到葡萄牙语转换方面存在 substantial variability。该基准可在https://github.com/maritaca-ai/MARCA 获取。
引用
@article{arxiv.2604.14449,
title = {Crowdsourcing of Real-world Image Annotation via Visual Properties},
author = {Xiaolei Diao and Fausto Giunchiglia},
journal= {arXiv preprint arXiv:2604.14449},
year = {2026}
}