Computation and Language · Computer Science
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
Yuri Kuratov, Aydar Bulatov, Petr Anokhin, Ivan Rodkin +3
2024-11-07
Computation and Language · Computer Science
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
Zhouhong Gu, Lin Zhang, Xiaoxuan Zhu, Jiangjie Chen +7
2024-11-12
Computation and Language · Computer Science
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
Zhan Ling, Kang Liu, Kai Yan, Yifan Yang +5
2025-11-19
Computation and Language · Computer Science
LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
Yiran Ding, Li Lyna Zhang, Chengruidong Zhang, Yuanyuan Xu +4
2024-02-22
Computation and Language · Computer Science
LooGLE: Can Long-Context Language Models Understand Long Contexts?
Jiaqi Li, Mengmeng Wang, Zilong Zheng, Muhan Zhang
2024-09-09
Computation and Language · Computer Science
Long-context Language Models Fail in Basic Retrieval Tasks Without Sufficient Reasoning Steps
Yijiong Yu, Yongfeng Huang, Zhixiao Qi, Wei Wang +3
2025-08-27
Computation and Language · Computer Science
Efficient Solutions For An Intriguing Failure of LLMs: Long Context Window Does Not Mean LLMs Can Analyze Long Sequences Flawlessly
Peyman Hosseini, Ignacio Castro, Iacopo Ghinassi, Matthew Purver
2024-12-23
Computation and Language · Computer Science
DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels
Zhe Xu, Jiasheng Ye, Xiaoran Liu, Xiangyang Liu +7
2025-03-17
Computation and Language · Computer Science
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
Xuanfan Ni, Hengyi Cai, Xiaochi Wei, Shuaiqiang Wang +2
2024-04-09
Machine Learning · Computer Science
TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning
Nicolas Zumarraga, Thomas Kaar, Ning Wang, William Tennien +11
2026-05-14
Computation and Language · Computer Science
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
Xi Ye, Fangcong Yin, Yinghui He, Joie Zhang +4
2025-09-30
Computation and Language · Computer Science
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
Yushi Bai, Xin Lv, Jiajie Zhang, Hongchang Lyu +9
2024-06-21
Computation and Language · Computer Science
Long-context LLMs Struggle with Long In-context Learning
Tianle Li, Ge Zhang, Quy Duc Do, Xiang Yue +1
2024-06-13
Computation and Language · Computer Science
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
Yushi Bai, Shangqing Tu, Jiajie Zhang, Hao Peng +8
2025-01-06
Computation and Language · Computer Science
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
Minzheng Wang, Longze Chen, Cheng Fu, Shengyi Liao +10
2024-10-04
Computation and Language · Computer Science
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
Utkarsh Tiwari, Aryan Seth, Adi Mukherjee, Kaavya Mer +2
2025-02-11
Computation and Language · Computer Science
Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP
Omer Goldman, Alon Jacovi, Aviv Slobodkin, Aviya Maimon +2
2025-07-08
Computation and Language · Computer Science
LooGLE v2: Are LLMs Ready for Real World Long Dependency Challenges?
Ziyuan He, Yuxuan Wang, Jiaqi Li, Kexin Liang +1
2025-10-28
Computation and Language · Computer Science
Are Language Models Efficient Reasoners? A Perspective from Logic Programming
Andreas Opedal, Yanick Zengaffinen, Haruki Shirakami, Clemente Pasti +4
2026-01-16
Computation and Language · Computer Science
Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali +6
2025-10-08