中文

Collage:面向科学 PDF 信息抽取的可分解快速原型设计工具

计算与语言 2025-06-25 v2 人机交互

摘要

近年来,NLP领域不断发展专业化信息抽取工具,同时也推出越来越多的多模态预训练变换模型。尽管科学家有机会评估并将这些系统应用于自身领域,但这些模型难以比较:它们接受不同的输入格式,往往是黑箱,对处理故障几乎无所了解,且很少处理PDF文档——这是科学出版物最常见的格式。本文介绍Collage,一款用于科学 PDF 信息抽取的快速原型设计、可视化与评估工具。Collage开箱即用,支持任何HuggingFace标记分类器、多种大语言模型(LLM)以及多种任务特定模型,并提供可扩展的软件接口以加速新模型的实验。进一步,Collage为开发者与用户提供了粒度化的处理状态视图,帮助检查、调试并更好地理解建模管道。我们以材料科学中的信息抽取为例,展示了该系统的实际应用场景。

关键词

引用

@article{arxiv.2410.23478,
  title  = {Collage: Decomposable Rapid Prototyping for Information Extraction on Scientific PDFs},
  author = {Sireesh Gururaja and Yueheng Zhang and Guannan Tang and Tianhao Zhang and Kevin Murphy and Yu-Tsen Yi and Junwon Seo and Anthony Rollett and Emma Strubell},
  journal= {arXiv preprint arXiv:2410.23478},
  year   = {2025}
}