中文

面向历史与文化文物的 LMM 评估基准:Time Travel

计算机视觉与模式识别 2025-02-21 v1 机器学习

摘要

理解历史与文化文物需要人类专家知识和先进的计算技术,但过程仍复杂且耗时。虽然大型多模态模型(LMM)提供了有前景的支持,但其评估和改进需要标准化基准。为此,我们引入 TimeTravel,一个包含 10,250 个专家验证样本、覆盖 266 个不同文化、跨越 10 个主要历史地区的基准。为 AI 驱动的手稿、艺术品、铭文和考古发现分析提供了结构化数据集和稳健的评估框架,以评估 AI 模型在分类、解释和历史理解方面的能力。通过将 AI 与历史研究结合,TimeTravel 促进了面向历史学家、考古学家、研究人员和文化旅游者的 AI 工具,帮助他们提取有价值的见解,同时确保技术在历史发现和文化遗产保护中发挥实质性作用。我们在 TimeTravel 上评估了当代 AI 模型,揭示了其优势并确定了改进方向。我们的目标是将 AI 建立为保存文化遗产可靠的合作伙伴,确保技术进步在历史发现中发挥实质性作用。我们的代码已发布于: \url{https://github.com/mbzuai-oryx/TimeTravel}。

关键词

引用

@article{arxiv.2502.14865,
  title  = {Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts},
  author = {Sara Ghaboura and Ketan More and Ritesh Thawkar and Wafa Alghallabi and Omkar Thawakar and Fahad Shahbaz Khan and Hisham Cholakkal and Salman Khan and Rao Muhammad Anwer},
  journal= {arXiv preprint arXiv:2502.14865},
  year   = {2025}
}

备注

4 pages, 6 figures