Computation and Language · Computer Science
ConceptPsy:A Benchmark Suite with Conceptual Comprehensiveness in Psychology
Junlei Zhang, Hongliang He, Nirui Song, Zhanchao Zhou +7
2024-06-18
Computation and Language · Computer Science
CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological Counseling
Chenhao Zhang, Renhao Li, Minghuan Tan, Min Yang +6
2024-06-11
Computation and Language · Computer Science
PsycoLLM: Enhancing LLM for Psychological Understanding and Evaluation
Jinpeng Hu, Tengteng Dong, Luo Gang, Hui Ma +5
2024-12-09
Computation and Language · Computer Science
CMMLU: Measuring massive multitask language understanding in Chinese
Haonan Li, Yixuan Zhang, Fajri Koto, Yifei Yang +4
2024-01-19
Computation and Language · Computer Science
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
Chenlu Guo, Nuo Xu, Yi Chang, Yuan Wu
2025-02-24
Artificial Intelligence · Computer Science
CPSDBench: A Large Language Model Evaluation Benchmark and Baseline for Chinese Public Security Domain
Xin Tong, Bo Jin, Zhi Lin, Binjun Wang +2
2024-03-22
Computation and Language · Computer Science
Benchmarking Large Language Models on CMExam -- A Comprehensive Chinese Medical Exam Dataset
Junling Liu, Peilin Zhou, Yining Hua, Dading Chong +7
2023-10-24
Computation and Language · Computer Science
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda
2025-11-25
Computation and Language · Computer Science
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
Zetian Ouyang, Yishuai Qiu, Linlin Wang, Gerard de Melo +3
2024-10-07
Artificial Intelligence · Computer Science
CJEval: A Benchmark for Assessing Large Language Models Using Chinese Junior High School Exam Data
Qian-Wen Zhang, Haochen Wang, Fang Li, Siyu An +4
2024-09-26
Computation and Language · Computer Science
MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models
Yan Cai, Linlin Wang, Ye Wang, Gerard de Melo +3
2023-12-21
Computation and Language · Computer Science
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
Jie Zhu, Junhui Li, Yalong Wen, Lifan Guo
2024-05-20
Computation and Language · Computer Science
Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li +2
2025-08-25
Computation and Language · Computer Science
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
Haitao Li, You Chen, Qingyao Ai, Yueyue Wu +2
2024-11-27
Computation and Language · Computer Science
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
Yunna Cai, Fan Wang, Haowei Wang, Kun Wang +4
2026-02-16
Computation and Language · Computer Science
C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models
Yuzhen Huang, Yuzhuo Bai, Zhihao Zhu, Junlei Zhang +9
2023-11-07
Computation and Language · Computer Science
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
Chuang Liu, Linhao Yu, Jiaxuan Li, Renren Jin +10
2024-03-20
Computation and Language · Computer Science
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
Fan Gao, Dongyuan Li, Ding Xia, Fei Mi +3
2025-06-04
Computation and Language · Computer Science
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
Tu Anh Dinh, Carlos Mullov, Leonard Bärmann, Zhaolin Li +14
2024-10-03
Computation and Language · Computer Science
PsychBench: A comprehensive and professional benchmark for evaluating the performance of LLM-assisted psychiatric clinical practice
Shuyu Liu, Ruoxi Wang, Ling Zhang, Xuequan Zhu +6
2025-06-19
Computation and Language · Computer Science
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
Chuang Liu, Renren Jin, Yuqi Ren, Deyi Xiong
2024-03-20
Computation and Language · Computer Science
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
Chengfeng Zhou, Ji Wang, Juanjuan Qin, Yining Wang +2
2025-02-04
Computation and Language · Computer Science
Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data
Qiongqiong Wang, Hardik Bhupendra Sailor, Tianchi Liu, Wenyu Zhang +6
2025-09-25
Computation and Language · Computer Science
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
Zexuan Qiu, Jingjing Li, Shijue Huang, Xiaoqi Jiao +2
2024-10-17
Computation and Language · Computer Science
AlignBench: Benchmarking Chinese Alignment of Large Language Models
Xiao Liu, Xuanyu Lei, Shengyuan Wang, Yue Huang +14
2024-08-27