Computation and Language · Computer Science
DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao +8
2026-01-30
Machine Learning · Computer Science
HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation
Hongyang Yang, Yanxin Zhang, Yang She, Yue Xiao +4
2026-04-02
Computation and Language · Computer Science
ReQA: An Evaluation for End-to-End Answer Retrieval Models
Amin Ahmad, Noah Constant, Yinfei Yang, Daniel Cer
2020-02-13
Computation and Language · Computer Science
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen +2
2026-04-28
Artificial Intelligence · Computer Science
HiRA: A Hierarchical Reasoning Framework for Decoupled Planning and Execution in Deep Search
Jiajie Jin, Xiaoxi Li, Guanting Dong, Yuyao Zhang +4
2025-11-03
Computation and Language · Computer Science
Did Aristotle Use a Laptop? A Question Answering Benchmark with Implicit Reasoning Strategies
Mor Geva, Daniel Khashabi, Elad Segal, Tushar Khot +2
2021-01-08
Computation and Language · Computer Science
RELOOP: Recursive Retrieval with Multi-Hop Reasoner and Planners for Heterogeneous QA
Ruiyi Yang, Hao Xue, Imran Razzak, Hakim Hacid +1
2026-04-24
Artificial Intelligence · Computer Science
Benchmarking Agents in Insurance Underwriting Environments
Amanda Dsouza, Ramya Ramakrishnan, Charles Dickens, Bhavishya Pohani +1
2026-02-03
Software Engineering · Computer Science
CoSQA+: Pioneering the Multi-Choice Code Search Benchmark with Test-Driven Agents
Jing Gong, Yanghui Wu, Linxi Liang, Yanlin Wang +3
2026-02-05
Computation and Language · Computer Science
FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting
Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao +3
2026-05-11
Information Retrieval · Computer Science
Benchmarking Real-Time Question Answering via Executable Code Workflows
Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu +4
2026-05-12
Artificial Intelligence · Computer Science
DataFactory: Collaborative Multi-Agent Framework for Advanced Table Question Answering
Tong Wang, Chi Jin, Yongkang Chen, Huan Deng +2
2026-03-11
Robotics · Computer Science
ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response
Xiaomeng Zhu, Fengming Zhu, Weijie Zhou, Ye Tian +7
2026-02-05
Computation and Language · Computer Science
DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
Aaryaman Kartha, Ahmed Masry, Mohammed Saidul Islam, Thinh Lang +7
2025-08-26
Computation and Language · Computer Science
HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
Hanhua Hong, Yizhi LI, Jiaoyan Chen, Sophia Ananiadou +3
2026-04-28
Computation and Language · Computer Science
Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics
Maojia Song, Renhang Liu, Xinyu Wang, Yong Jiang +5
2025-12-11
Artificial Intelligence · Computer Science
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah +1
2026-04-23
Artificial Intelligence · Computer Science
HippoCamp: Benchmarking Contextual Agents on Personal Computers
Zhe Yang, Shulin Tian, Kairui Hu, Shuai Liu +8
2026-04-02
Computation and Language · Computer Science
Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models
Yu Tian, Linh Huynh, Katerina Christhilf, Shubham Chakraborty +3
2026-02-04
Artificial Intelligence · Computer Science
CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space
Yong Zhao, Kai Xu, Zhengqiu Zhu, Yue Hu +6
2025-05-23
Artificial Intelligence · Computer Science
MapAgent: A Hierarchical Agent for Geospatial Reasoning with Dynamic Map Tool Integration
Md Hasebul Hasan, Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali +1
2025-10-15
Artificial Intelligence · Computer Science
Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling
Zizhang Luo, Yuhao Luo, Youwei Xiao, Yansong Xu +2
2026-04-21
Computation and Language · Computer Science
RETQA: A Large-Scale Open-Domain Tabular Question Answering Dataset for Real Estate Sector
Zhensheng Wang, Wenmian Yang, Kun Zhou, Yiquan Zhang +1
2025-05-12
Artificial Intelligence · Computer Science
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins, Ivan Zhou +9
2026-03-10
Machine Learning · Computer Science
Eureka: Evaluating and Understanding Large Foundation Models
Vidhisha Balachandran, Jingya Chen, Neel Joshi, Besmira Nushi +5
2024-09-18