Computation and Language · Computer Science
ExplainaBoard: An Explainable Leaderboard for NLP
Pengfei Liu, Jinlan Fu, Yang Xiao, Weizhe Yuan +6
2021-07-05
Computation and Language · Computer Science
The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models
Giwon Hong, Aryo Pradipta Gema, Rohit Saxena, Xiaotang Du +7
2024-04-18
Computation and Language · Computer Science
Evoke: Evoking Critical Thinking Abilities in LLMs via Reviewer-Author Prompt Editing
Xinyu Hu, Pengfei Tang, Simiao Zuo, Zihan Wang +4
2023-10-24
Computation and Language · Computer Science
Self-Improving-Leaderboard(SIL): A Call for Real-World Centric Natural Language Processing Leaderboards
Chanjun Park, Hyeonseok Moon, Seolhwa Lee, Jaehyung Seo +2
2023-03-21
Computation and Language · Computer Science
Adaptable and Reliable Text Classification using Large Language Models
Zhiqiang Wang, Yiran Pang, Yanbin Lin, Xingquan Zhu
2024-12-10
Hardware Architecture · Computer Science
EvoVerilog: Large Langugage Model Assisted Evolution of Verilog Code
Ping Guo, Yiting Wang, Wanghao Ye, Yexiao He +4
2025-08-20
Artificial Intelligence · Computer Science
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen +1
2026-05-11
Computation and Language · Computer Science
Evalverse: Unified and Accessible Library for Large Language Model Evaluation
Jihoo Kim, Wonho Song, Dahyun Kim, Yunsu Kim +2
2024-10-08
Software Engineering · Computer Science
Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM
Chunqiu Steven Xia, Yinlin Deng, Lingming Zhang
2024-03-29
Machine Learning · Computer Science
Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries
Blair Yang, Fuyang Cui, Keiran Paster, Jimmy Ba +3
2024-09-04
Computation and Language · Computer Science
ToolQA: A Dataset for LLM Question Answering with External Tools
Yuchen Zhuang, Yue Yu, Kuan Wang, Haotian Sun +1
2023-06-26
Computation and Language · Computer Science
ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models
Hanxing Ding, Shuchang Tao, Liang Pang, Zihao Wei +4
2025-06-02
Machine Learning · Computer Science
The Explabox: Model-Agnostic Machine Learning Transparency & Analysis
Marcel Robeer, Michiel Bron, Elize Herrewijnen, Riwish Hoeseni +1
2024-11-26
Computation and Language · Computer Science
Can LLM-Generated Textual Explanations Enhance Model Classification Performance? An Empirical Study
Mahdi Dhaini, Juraj Vladika, Ege Erdogan, Zineb Attaoui +1
2025-11-12
Computation and Language · Computer Science
EasyInstruct: An Easy-to-use Instruction Processing Framework for Large Language Models
Yixin Ou, Ningyu Zhang, Honghao Gui, Ziwen Xu +8
2024-06-25
Computation and Language · Computer Science
Evalita-LLM: Benchmarking Large Language Models on Italian
Bernardo Magnini, Roberto Zanoli, Michele Resta, Martin Cimmino +3
2025-02-05
Computation and Language · Computer Science
tinyBenchmarks: evaluating LLMs with fewer examples
Felipe Maia Polo, Lucas Weber, Leshem Choshen, Yuekai Sun +2
2024-05-28
Computers and Society · Computer Science
Large language models in climate and sustainability policy: limits and opportunities
Francesca Larosa, Sergio Hoyas, H. Alberto Conejero, Javier Garcia-Martinez +2
2025-02-05
Computation and Language · Computer Science
Elo Uncovered: Robustness and Best Practices in Language Model Evaluation
Meriem Boubdir, Edward Kim, Beyza Ermis, Sara Hooker +1
2023-11-30
Computation and Language · Computer Science
RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting
Lei Shu, Liangchen Luo, Jayakumar Hoskere, Yun Zhu +4
2023-12-21