Computation and Language · Computer Science
Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations
Zhuoyan Li, Hangxiao Zhu, Zhuoran Lu, Ming Yin
2023-10-16
Computation and Language · Computer Science
On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey
Lin Long, Rui Wang, Ruixuan Xiao, Junbo Zhao +3
2024-06-24
Artificial Intelligence · Computer Science
The LLM Data Auditor: A Metric-oriented Survey on Quality and Trustworthiness in Evaluating Synthetic Data
Kaituo Zhang, Mingzhi Hu, Hoang Anh Duy Le, Fariha Kabir Torsha +8
2026-01-28
Information Retrieval · Computer Science
Generating Diverse Synthetic Datasets for Evaluation of Real-life Recommender Systems
Miha Malenšek, Blaž Škrlj, Blaž Mramor, Jure Demšar
2024-12-11
Computation and Language · Computer Science
Data Generation Using Large Language Models for Text Classification: An Empirical Case Study
Yinheng Li, Rogerio Bonatti, Sara Abdali, Justin Wagle +1
2024-07-23
Computation and Language · Computer Science
A Survey on Data Synthesis and Augmentation for Large Language Models
Ke Wang, Jiahui Zhu, Minjie Ren, Zeming Liu +7
2024-10-18
Computation and Language · Computer Science
Privacy-Preserving Synthetic Review Generation with Diverse Writing Styles Using LLMs
Tevin Atwal, Chan Nam Tieu, Yefeng Yuan, Zhan Shi +2
2025-07-25
Machine Learning · Computer Science
Quality Matters: Evaluating Synthetic Data for Tool-Using LLMs
Shadi Iskander, Nachshon Cohen, Zohar Karnin, Ori Shapira +1
2024-09-27
Computation and Language · Computer Science
On the Evaluation of Machine-Generated Reports
James Mayfield, Eugene Yang, Dawn Lawrie, Sean MacAvaney +9
2024-05-13
Computation and Language · Computer Science
Artificial Conversations, Real Results: Fostering Language Detection with Synthetic Data
Fatemeh Mohammadi, Tommaso Romano, Samira Maghool, Paolo Ceravolo
2025-04-01
Computation and Language · Computer Science
A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and Recommendations
Md Tahmid Rahman Laskar, Sawsan Alqahtani, M Saiful Bari, Mizanur Rahman +9
2024-10-04
Machine Learning · Computer Science
Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Text Classification
Hsun-Yu Kuo, Yin-Hsiang Liao, Yu-Chieh Chao, Wei-Yun Ma +1
2025-03-25
Computation and Language · Computer Science
DataGen: Unified Synthetic Dataset Generation via Large Language Models
Yue Huang, Siyuan Wu, Chujie Gao, Dongping Chen +7
2025-11-18
Computation and Language · Computer Science
Synthetic Data Generation for Phrase Break Prediction with Large Language Model
Hoyeon Lee, Sejung Son, Ye-Eun Kang, Jong-Hwan Kim
2025-07-25
Computation and Language · Computer Science
A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages
Tatiana Anikina, Jan Cegin, Jakub Simko, Simon Ostermann
2025-09-22
Computation and Language · Computer Science
More Data or Better Data? A Critical Analysis of Data Selection and Synthesis for Mathematical Reasoning
Yike Zhao, Simin Guo, Ziqing Yang, Shifan Han +2
2025-10-09
Computation and Language · Computer Science
A Scoping Review of Synthetic Data Generation by Language Models in Biomedical Research and Application: Data Utility and Quality Perspectives
Hanshu Rao, Weisi Liu, Haohan Wang, I-Chan Huang +2
2026-02-18
Computation and Language · Computer Science
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
Seyoung Song, Seogyeong Jeong, Eunsu Kim, Jiho Jin +3
2025-11-11
Computation and Language · Computer Science
Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
Zhen Li, Xiaohan Xu, Tao Shen, Can Xu +4
2024-06-13