Computation and Language · Computer Science
Arctic-TILT. Business Document Understanding at Sub-Billion Scale
Łukasz Borchmann, Michał Pietruszka, Wojciech Jaśkowski, Dawid Jurkiewicz +12
2024-08-09
Computation and Language · Computer Science
PLAtE: A Large-scale Dataset for List Page Web Extraction
Aidan San, Yuan Zhuang, Jan Bakus, Colin Lockard +5
2023-06-16
Information Retrieval · Computer Science
The future of document indexing: GPT and Donut revolutionize table of content processing
Degaga Wolde Feyisa, Haylemicheal Berihun, Amanuel Zewdu, Mahsa Najimoghadam +1
2024-03-13
Computation and Language · Computer Science
MaTableGPT: GPT-based Table Data Extractor from Materials Science Literature
Gyeong Hoon Yi, Jiwoo Choi, Hyeongyun Song, Olivia Miano +8
2024-06-11
Digital Libraries · Computer Science
Extracting Scientific Figures with Distantly Supervised Neural Networks
Noah Siegel, Nicholas Lourie, Russell Power, Waleed Ammar
2018-06-01
Computation and Language · Computer Science
Efficient Document-level Event Extraction via Pseudo-Trigger-aware Pruned Complete Graph
Tong Zhu, Xiaoye Qu, Wenliang Chen, Zhefeng Wang +3
2022-10-05
Computer Vision and Pattern Recognition · Computer Science
Uni-Parser Technical Report
Xi Fang, Haoyi Tao, Shuwen Yang, Chaozheng Huang +7
2026-03-16
Machine Learning · Computer Science
Data-Efficient Information Extraction from Form-Like Documents
Beliz Gunel, Navneet Potti, Sandeep Tata, James B. Wendt +2
2022-01-14
Computation and Language · Computer Science
EXIT: Context-Aware Extractive Compression for Enhancing Retrieval-Augmented Generation
Taeho Hwang, Sukmin Cho, Soyeong Jeong, Hoyun Song +2
2025-05-30
Computer Vision and Pattern Recognition · Computer Science
Flexible Table Recognition and Semantic Interpretation System
Marcin Namysl, Alexander M. Esser, Sven Behnke, Joachim Köhler
2021-12-03
Computation and Language · Computer Science
AxCell: Automatic Extraction of Results from Machine Learning Papers
Marcin Kardas, Piotr Czapla, Pontus Stenetorp, Sebastian Ruder +3
2020-04-30
Information Retrieval · Computer Science
A Benchmark of PDF Information Extraction Tools using a Multi-Task and Multi-Domain Evaluation Framework for Academic Documents
Norman Meuschke, Apurva Jagdale, Timo Spinde, Jelena Mitrović +1
2023-03-20
Neural and Evolutionary Computing · Computer Science
Extracting Tables from Documents using Conditional Generative Adversarial Networks and Genetic Algorithms
Nataliya Le Vine, Matthew Zeigenfuse, Mark Rowan
2019-04-04
Computer Vision and Pattern Recognition · Computer Science
Document Structure Extraction using Prior based High Resolution Hierarchical Semantic Segmentation
Mausoom Sarkar, Milan Aggarwal, Arneh Jain, Hiresh Gupta +1
2020-09-18
Information Retrieval · Computer Science
MatSKRAFT: A framework for large-scale materials knowledge extraction from scientific tables
Kausik Hira, Mohd Zaki, Mausam, N. M. Anoop Krishnan
2025-09-15
Computation and Language · Computer Science
Doc2Dict: Information Extraction as Text Generation
Benjamin Townsend, Eamon Ito-Fisher, Lily Zhang, Madison May
2021-10-12
Computation and Language · Computer Science
Toward Reliable Ad-hoc Scientific Information Extraction: A Case Study on Two Materials Datasets
Satanu Ghosh, Neal R. Brodnik, Carolina Frey, Collin Holgate +3
2025-11-18
Computer Vision and Pattern Recognition · Computer Science
ScanBank: A Benchmark Dataset for Figure Extraction from Scanned Electronic Theses and Dissertations
Sampanna Yashwant Kahu, William A. Ingram, Edward A. Fox, Jian Wu
2021-06-30
Databases · Computer Science
TWIX: Automatically Reconstructing Structured Data from Templatized Documents
Yiming Lin, Mawil Hasan, Rohan Kosalge, Alvin Cheung +1
2025-01-14