中文

RoSE:循环轮换合成数据评估——在无需人工测试集的情况下选择 LLM 生成器

计算与语言 2025-10-08 v1

摘要

大语言模型(LLM)是合成数据的强大生成器,可用于训练更小、更专用的模型。这对于低资源语言尤其有价值,因为这些语言中人工标注数据稀缺,但 LLM 仍能生成高质量文本。然而,不同 LLM 的输出对训练的有用程度各不相同。选择最佳 LLM 作为生成器具有挑战性,因为外部评估需要昂贵的人工标注(低资源语言中往往不可用),而内部指标与下游性能相关性较差。我们提出了循环轮换合成数据评估(RoSE),一种无需人工测试集即可选择最佳 LLM 生成器的代理指标。RoSE 在候选生成器(LLM)的输出上训练一个小模型,然后在所有其他候选 LLM 生成的合成样本上对其进行评估。最终的 RoSE 分数是该小模型的平均性能。在六个 LLM、十一种语言和三个任务(情感、主题、意图)上,RoSE 比任何其他内部启发式方法更频繁地识别出最优生成器。RoSE 优于内部启发式方法,且与最优生成器基线的差距在 0.76 个百分点以内。该结果以训练小模型于所选生成器输出(最优 vs. 代理指标所选)并在人工标注测试数据上评估的下游性能来衡量。此外,RoSE 是唯一与人工测试数据上的性能呈正相关的指标。

关键词

引用

@article{arxiv.2510.06143,
  title  = {RoSE: Round-robin Synthetic Data Evaluation for Selecting LLM Generators without Human Test Sets},
  author = {Jan Cegin and Branislav Pecher and Ivan Srba and Jakub Simko},
  journal= {arXiv preprint arXiv:2510.06143},
  year   = {2025}
}

备注

16 pages