中文

ScholarBench:面向学术语境下的抽象、理解与推理评估的双语基准

计算机视觉与模式识别 2025-11-26 v2

摘要

现有针对大型语言模型(LLM)领域特定知识评估的基准缺乏处理复杂学术任务的可扩展性。为此,我们引入了\texttt{ScholarBench},一个以深入专业知识和复杂学术问题解决为中心的基准,旨在评估LLMs的学术推理能力,其构建通过三个步骤完成。\texttt{ScholarBench}针对来自学术文献中更专业且逻辑更复杂的情境,涵盖五种不同的问题类型。与先前的基准不同,\texttt{ScholarBench}跨越八个不同的研究领域,评估LLMs的抽象、理解和推理能力。为确保高质量的评估数据,我们定义了类别特定的示例属性,并设计与每个领域特征性研究方法和话语结构相匹配的问题。此外,本基准作为一个英语-韩语双语数据集,促进了LLMs在两种语言中的语言能力的同时评估。该基准包含5,031个韩语示例和5,309个英文示例,尽管像o3-mini等最先进模型仅获得0.543的平均评估得分,表明该基准具有较高的挑战性。

关键词

引用

@article{arxiv.2505.16565,
  title  = {M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion},
  author = {Nina Shvetsova and Goutam Bhat and Prune Truong and Hilde Kuehne and Federico Tombari},
  journal= {arXiv preprint arXiv:2505.16565},
  year   = {2025}
}

备注

To be published at 3DV 2026, project webpage https://m2svid.github.io/