Software Engineering · Computer Science
Benchmarking Large Language Models for ABAP Code Generation: An Empirical Study on Iterative Improvement by Compiler Feedback
Stephan Wallraven, Tim Köhne, Hartmut Westenberger, Andreas Moser
2026-01-22
Software Engineering · Computer Science
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
Hao Yu, Bo Shen, Dezhi Ran, Jiaxin Zhang +6
2024-02-26
Machine Learning · Computer Science
Multi-lingual Evaluation of Code Generation Models
Ben Athiwaratkun, Sanjay Krishna Gouda, Zijian Wang, Xiaopeng Li +21
2023-03-30
Software Engineering · Computer Science
Using Large Language Models to Generate JUnit Tests: An Empirical Study
Mohammed Latif Siddiq, Joanna C. S. Santos, Ridwanul Hasan Tanvir, Noshin Ulfat +2
2024-08-29
Software Engineering · Computer Science
Measuring Coding Challenge Competence With APPS
Dan Hendrycks, Steven Basart, Saurav Kadavath, Mantas Mazeika +7
2021-11-10
Distributed, Parallel, and Cluster Computing · Computer Science
Can Large Language Models Write Parallel Code?
Daniel Nichols, Joshua H. Davis, Zhaojun Xie, Arjun Rajaram +1
2024-05-15
Software Engineering · Computer Science
An Empirical Evaluation of Competitive Programming AI: A Case Study of AlphaCode
Sila Lertbanjongngam, Bodin Chinthanet, Takashi Ishio, Raula Gaikovina Kula +4
2022-08-29
Software Engineering · Computer Science
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
Yuwei Zhao, Ziyang Luo, Yuchen Tian, Hongzhan Lin +3
2024-09-16
Software Engineering · Computer Science
GenX: Mastering Code and Test Generation with Execution Feedback
Nan Wang, Yafei Liu, Chen Chen, Haonan Lu
2024-12-19
Software Engineering · Computer Science
On the Robustness of Code Generation Techniques: An Empirical Study on GitHub Copilot
Antonio Mastropaolo, Luca Pascarella, Emanuela Guglielmi, Matteo Ciniselli +3
2023-02-02
Artificial Intelligence · Computer Science
ContractEval: A Benchmark for Evaluating Contract-Satisfying Assertions in Code Generation
Soohan Lim, Joonghyuk Hahn, Hyunwoo Park, Sang-Ki Ko +1
2026-04-21
Computation and Language · Computer Science
CodeT: Code Generation with Generated Tests
Bei Chen, Fengji Zhang, Anh Nguyen, Daoguang Zan +3
2022-11-24
Computation and Language · Computer Science
ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation
Xueying Du, Mingwei Liu, Kaixin Wang, Hanlin Wang +6
2023-08-15
Machine Learning · Computer Science
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
Qinkai Zheng, Xiao Xia, Xu Zou, Yuxiao Dong +9
2024-07-11
Human-Computer Interaction · Computer Science
Better Together? An Evaluation of AI-Supported Code Translation
Justin D. Weisz, Michael Muller, Steven I. Ross, Fernando Martinez +4
2022-02-17
Software Engineering · Computer Science
A Survey of Automatic Generation of Source Code Comments: Algorithms and Techniques
Xiaotao Song, Hailong Sun, Xu Wang, Jiafei Yan
2019-07-31
Software Engineering · Computer Science
Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes
Heejae Chon, Seonghyeon Lee, Jinyoung Yeo, Dongha Lee
2024-08-28
Software Engineering · Computer Science
AixBench: A Code Generation Benchmark Dataset
Yiyang Hao, Ge Li, Yongqiang Liu, Xiaowei Miao +4
2022-07-22
Software Engineering · Computer Science
Aligning Offline Metrics and Human Judgments of Value for Code Generation Models
Victor Dibia, Adam Fourney, Gagan Bansal, Forough Poursabzi-Sangdeh +2
2023-06-14