NoTeS-Bank:用于科学笔记理解的神经转录和搜索基准
计算机视觉与模式识别
2025-04-15 v1 信息检索
机器学习
多媒体
摘要
理解和推理 academic 手写笔记仍是文档 AI 中的挑战,尤其是对于数学方程、图表和科学符号。现有的视觉问答 (VQA) 基准仅关注打印或结构化手写文本,限制了其对现实笔记记录的泛化能力。为此,我们引入 NoTeS-Bank,用于 note-based 问答中的神经转录和搜索评估基准。NoTeS-Bank 包含跨多个领域的复杂笔记,要求模型处理非结构化和多模态内容。该基准定义了两个任务:(1)基于证据的 VQA,其中模型检索带有边界框证据的局部答案;(2)开放域 VQA,其中模型在检索相关文档和答案之前对领域进行分类。与经典 Document VQA 数据集依赖光学字符识别 (OCR) 和结构化数据的不同之处在于,NoTeS-BANK 需要视觉-语言融合、检索和多模态推理。我们对最先进的视觉-语言模型 (VLM) 和检索框架进行基准测试,暴露出结构化转录和推理限制。NoTeS-Bank 提供严格的评估,包括 NDCG@5、MRR、Recall@K、IoU 和 ANLS,确立了视觉文档理解和推理的新标准。
引用
@article{arxiv.2504.09249,
title = {NoTeS-Bank: Benchmarking Neural Transcription and Search for Scientific Notes Understanding},
author = {Aniket Pal and Sanket Biswas and Alloy Das and Ayush Lodh and Priyanka Banerjee and Soumitri Chattopadhyay and Dimosthenis Karatzas and Josep Llados and C. V. Jawahar},
journal= {arXiv preprint arXiv:2504.09249},
year = {2025}
}