Computation and Language · Computer Science
A Survey on the Honesty of Large Language Models
Siheng Li, Cheng Yang, Taiqiang Wu, Chufan Shi +11
2024-09-30
Computation and Language · Computer Science
Factuality of Large Language Models: A Survey
Yuxia Wang, Minghan Wang, Muhammad Arslan Manzoor, Fei Liu +3
2024-11-01
Computation and Language · Computer Science
A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and Recommendations
Md Tahmid Rahman Laskar, Sawsan Alqahtani, M Saiful Bari, Mizanur Rahman +9
2024-10-04
Computation and Language · Computer Science
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng +5
2025-06-17
Computation and Language · Computer Science
Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning
Bahare Fatemi, Mehran Kazemi, Anton Tsitsulin, Karishma Malkan +5
2024-06-14
Artificial Intelligence · Computer Science
RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
Jie Zhang, Cezara Petrui, Kristina Nikolić, Florian Tramèr
2025-10-21
Artificial Intelligence · Computer Science
Autonomous Evaluation of LLMs for Truth Maintenance and Reasoning Tasks
Rushang Karia, Daniel Bramblett, Daksh Dobhal, Siddharth Srivastava
2025-04-15
Computation and Language · Computer Science
Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs
Xiaoze Liu, Feijie Wu, Tianyang Xu, Zhuo Chen +3
2024-04-02
Computation and Language · Computer Science
GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models
Hengyu Luo, Zihao Li, Joseph Attieh, Sawal Devkota +11
2025-10-09
Computation and Language · Computer Science
Benchmarking LLMs via Uncertainty Quantification
Fanghua Ye, Mingming Yang, Jianhui Pang, Longyue Wang +4
2024-11-01
Computation and Language · Computer Science
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
Yifei Ming, Senthil Purushwalkam, Shrey Pandit, Zixuan Ke +3
2025-04-28
Computation and Language · Computer Science
Factual Confidence of LLMs: on Reliability and Robustness of Current Estimators
Matéo Mahaut, Laura Aina, Paula Czarnowska, Momchil Hardalov +2
2024-11-28
Computation and Language · Computer Science
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
Zhaolu Kang, Junhao Gong, Wenqing Hu, Shuo Yin +14
2026-01-19
Machine Learning · Computer Science
Pitfalls in Evaluating Language Model Forecasters
Daniel Paleka, Shashwat Goel, Jonas Geiping, Florian Tramèr
2025-06-03
Computation and Language · Computer Science
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
Junnan Zhu, Jingyi Wang, Bohan Yu, Xiaoyu Wu +3
2025-09-23
Computation and Language · Computer Science
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu +16
2025-10-13
Computation and Language · Computer Science
Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity
Cunxiang Wang, Xiaoze Liu, Yuanhao Yue, Xiangru Tang +12
2023-12-19
Computation and Language · Computer Science
FELM: Benchmarking Factuality Evaluation of Large Language Models
Shiqi Chen, Yiran Zhao, Jinghan Zhang, I-Chun Chern +3
2023-11-29
Computation and Language · Computer Science
OneEval: Benchmarking LLM Knowledge-intensive Reasoning over Diverse Knowledge Bases
Yongrui Chen, Zhiqiang Liu, Jing Yu, Lin Ren +20
2025-06-17
Software Engineering · Computer Science
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu +16
2026-04-06
Computation and Language · Computer Science
A Survey on Evaluation of Large Language Models
Yupeng Chang, Xu Wang, Jindong Wang, Yuan Wu +12
2024-01-01
Computation and Language · Computer Science
A Survey of Confidence Estimation and Calibration in Large Language Models
Jiahui Geng, Fengyu Cai, Yuxia Wang, Heinz Koeppl +2
2024-03-26
Computation and Language · Computer Science
HonestLLM: Toward an Honest and Helpful Large Language Model
Chujie Gao, Siyuan Wu, Yue Huang, Dongping Chen +5
2024-12-12
Artificial Intelligence · Computer Science
BELL: Benchmarking the Explainability of Large Language Models
Syed Quiser Ahmed, Bharathi Vokkaliga Ganesh, Jagadish Babu P, Karthick Selvaraj +2
2025-04-29