Machine Learning · Computer Science
FactSelfCheck: Fact-Level Black-Box Hallucination Detection for LLMs
Albert Sawczyn, Jakub Binkowski, Denis Janiak, Bogdan Gabrys +1
2026-02-02
Computation and Language · Computer Science
Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers
Yuxia Wang, Revanth Gangi Reddy, Zain Muhammad Mujahid, Arnav Arora +9
2024-04-17
Computation and Language · Computer Science
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng +5
2025-06-17
Computation and Language · Computer Science
Consistency Is the Key: Detecting Hallucinations in LLM Generated Text By Checking Inconsistencies About Key Facts
Raavi Gupta, Pranav Hari Panicker, Sumit Bhatia, Ganesh Ramakrishnan
2025-11-18
Computation and Language · Computer Science
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba +4
2026-01-06
Computation and Language · Computer Science
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
Farima Fatahi Bayat, Lechen Zhang, Sheza Munir, Lu Wang
2025-01-09
Computation and Language · Computer Science
FactLens: Benchmarking Fine-Grained Fact Verification
Kushan Mitra, Dan Zhang, Sajjadur Rahman, Estevam Hruschka
2025-06-03
Computation and Language · Computer Science
FELM: Benchmarking Factuality Evaluation of Large Language Models
Shiqi Chen, Yiran Zhao, Jinghan Zhang, I-Chun Chern +3
2023-11-29
Computation and Language · Computer Science
FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees
Fan Nie, Xiaotian Hou, Shuhang Lin, James Zou +2
2024-11-08
Computation and Language · Computer Science
Generative Large Language Models in Automated Fact-Checking: A Survey
Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko
2024-10-31
Computation and Language · Computer Science
Large Language Models, scientific knowledge and factuality: A framework to streamline human expert evaluation
Magdalena Wysocka, Oskar Wysocki, Maxime Delmas, Vincent Mutel +1
2024-10-21
Artificial Intelligence · Computer Science
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng +35
2026-04-22
Computation and Language · Computer Science
Fact-Controlled Diagnosis of Hallucinations in Medical Text Summarization
Suhas BN, Han-Chin Shing, Lei Xu, Mitch Strong +8
2025-06-03
Computation and Language · Computer Science
FaStfact: Faster, Stronger Long-Form Factuality Evaluations in LLMs
Yingjia Wan, Haochen Tan, Xiao Zhu, Xinyu Zhou +8
2025-11-06
Computation and Language · Computer Science
Large Language Models in the Clinic: A Comprehensive Benchmark
Fenglin Liu, Zheng Li, Hongjian Zhou, Qingyu Yin +15
2024-10-17
Computation and Language · Computer Science
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou +4
2025-11-18
Computation and Language · Computer Science
FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification
Xiangyan Chen, Yufeng Li, Yujian Gan, Arkaitz Zubiaga +1
2025-08-11
Computation and Language · Computer Science
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
Hasan Iqbal, Yuxia Wang, Minghan Wang, Georgi Georgiev +3
2025-10-30
Computation and Language · Computer Science
OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs
Yuxia Wang, Minghan Wang, Hasan Iqbal, Georgi Georgiev +2
2025-10-30
Computation and Language · Computer Science
Towards Detecting LLMs Hallucination via Markov Chain-based Multi-agent Debate Framework
Xiaoxi Sun, Jinpeng Li, Yan Zhong, Dongyan Zhao +1
2024-06-06
Computation and Language · Computer Science
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
Yao Wu, Kangping Yin, Liang Dong, Zhenxin Ma +12
2026-03-17
Computation and Language · Computer Science
Fact-checking with Generative AI: A Systematic Cross-Topic Examination of LLMs Capacity to Detect Veracity of Political Information
Elizaveta Kuznetsova, Ilaria Vitulano, Mykola Makhortykh, Martha Stolze +2
2025-03-12
Computation and Language · Computer Science
Towards a Holistic Evaluation of LLMs on Factual Knowledge Recall
Jiaqing Yuan, Lin Pan, Chung-Wei Hang, Jiang Guo +4
2024-04-26