Computation and Language · Computer Science
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye
2026-05-01
Computation and Language · Computer Science
NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities
Mo Li, Songyang Zhang, Taolin Zhang, Haodong Duan +2
2025-09-18
Machine Learning · Computer Science
Eliciting Latent Knowledge from Quirky Language Models
Alex Mallen, Madeline Brumley, Julia Kharchenko, Nora Belrose
2024-08-12
Computation and Language · Computer Science
OpaqueToolsBench: Learning Nuances of Tool Behavior Through Interaction
Skyler Hallinan, Thejas Venkatesh, Xiang Ren, Sai Praneeth Karimireddy +3
2026-02-18
Computer Vision and Pattern Recognition · Computer Science
Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models
Zhaochen Liu, Kaiwen Gao, Shuyi Liang, Bin Xiao +3
2025-08-07
Artificial Intelligence · Computer Science
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
Nasim Borazjanizadeh, Roei Herzig, Trevor Darrell, Rogerio Feris +1
2025-09-16
Computer Vision and Pattern Recognition · Computer Science
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
Zijian Chen, Tingzhu Chen, Wenjun Zhang, Guangtao Zhai
2025-02-12
Machine Learning · Computer Science
From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?
Zhanke Zhou, Xiao Feng, Zhaocheng Zhu, Jiangchao Yao +2
2025-06-11
Computer Vision and Pattern Recognition · Computer Science
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
Thomas De Min, Subhankar Roy, Stéphane Lathuilière, Elisa Ricci +1
2026-03-23
Machine Learning · Computer Science
Over-Searching in Search-Augmented Large Language Models
Roy Xie, Deepak Gopinath, David Qiu, Dong Lin +3
2026-03-12
Artificial Intelligence · Computer Science
OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces
Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding +3
2026-05-12
Computation and Language · Computer Science
DarkBench: Benchmarking Dark Patterns in Large Language Models
Esben Kran, Hieu Minh "Jord" Nguyen, Akash Kundu, Sami Jawhar +2
2025-03-17
Computation and Language · Computer Science
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
Zhouhong Gu, Lin Zhang, Xiaoxuan Zhu, Jiangjie Chen +7
2024-11-12
Artificial Intelligence · Computer Science
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding +3
2025-06-13
Computer Vision and Pattern Recognition · Computer Science
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu +5
2026-05-12
Artificial Intelligence · Computer Science
AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions
Polina Kirichenko, Mark Ibrahim, Kamalika Chaudhuri, Samuel J. Bell
2025-06-11
Information Retrieval · Computer Science
Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead
Abdelrahman Abdallah, Jamie Holdcroft, Mohammed Ali, Adam Jatowt
2026-04-07
Computation and Language · Computer Science
OKBench: Democratizing LLM Evaluation with Fully Automated, On-Demand, Open Knowledge Benchmarking
Yanhong Li, Tianyang Xu, Kenan Tang, Karen Livescu +2
2025-11-13
Computation and Language · Computer Science
Benchmarking Deflection and Hallucination in Large Vision-Language Models
Nicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro, Bill Byrne +1
2026-04-15
Computation and Language · Computer Science
Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval and haystacks
Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty
2025-04-18
Computation and Language · Computer Science
When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering
Doeun Lee, Muge Zhang, Yi Yu, Ashish Manne +10
2026-05-22
Computation and Language · Computer Science
Correct-Detect: Balancing Performance and Ambiguity Through the Lens of Coreference Resolution in LLMs
Amber Shore, Russell Scheinberg, Ameeta Agrawal, So Young Lee
2025-10-22
Computation and Language · Computer Science
ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge
Zeinab Sadat Taghavi, Ali Modarressi, Yunpu Ma, Hinrich Schütze
2025-09-26
Computation and Language · Computer Science
TurtleBench: Evaluating Top Language Models via Real-World Yes/No Puzzles
Qingchen Yu, Shichao Song, Ke Fang, Yunfeng Shi +4
2024-10-08
Computation and Language · Computer Science
Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question Answering
Zhanghao Hu, Hanqi Yan, Qinglin Zhu, Zhenyi Shen +2
2025-09-23