中文

STELLAR-E:面向大语言模型应用的全自动合成、定制化、端到端评估器

人工智能 2026-04-28 v1 计算与语言

摘要

大语言模型(LLM)在跨越多个领域的广泛应用中,凸显了对稳健特定领域和特定语言评估数据集的需求;然而,由于隐私顾虑、监管限制以及手动创建的高昂成本,收集此类数据集具有较大挑战性。现有自动化基准测试方法常受限于依赖现有数据、可扩展性差、单一领域聚焦以及缺乏多语言支持。我们提出STELLAR-E——一个全自动生成自定义规模高质量合成数据集的系统,最小化人工输入且不依赖现有数据集。该系统包含两个阶段:(1)修改TGRT Self-Instruct框架,构建实现可控、定制化合成数据集生成的引擎;(2)构建评估管道,融合统计学指标与LLM-based指标,评估合成数据集在LLM应用评估中的适用性。与现有语言特定基准相比,合成数据集在LLM-as-a-judge评分方面平均提升5.7%,在全面评估大型和小型LLM方面表现相当。尽管真实数据集在LLM测试中仍略具挑战性,尤其是对小型模型而言,但本工作构建了可扩展且领域适应性强的基准框架,支持LLM应用的公平评估,为手动方法提供了更快的替代方案,并实现高效的自动化质量保证循环。

关键词

引用

@article{arxiv.2604.24544,
  title  = {STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator},
  author = {Alessio Sordo and Lingxiao Du and Meeka-Hanna Lenisa and Evgeny Bogdanov and Maxim Romanovsky},
  journal= {arXiv preprint arXiv:2604.24544},
  year   = {2026}
}