生成、评估、迭代:用于人类在回环中细化 LLM 评判器的合成数据
人机交互
2025-11-07 v1 人工智能
摘要
LLM 作为评判器范式实现了灵活的用户定义评估,但其有效性往往受限于稀缺且不具代表性的数据用于细化标准。我们提供了一个工具,将合成数据生成集成到 LLM 作为评判器的工作流程中,使用户能够创建具有可配置领域、人物格言、长度和所需结果的量身定制且具有挑战性的测试用例,包括边缘情况。该工具还支持 AI 辅助的内联编辑现有测试用例。为增强透明度和可解释性,它揭示每一次生成背后的提示和解释。在一项用户研究(N=24)中,83% 的参与者表示更倾向于使用该工具来创建或选择测试用例,因为它使他们能够快速生成多样化的合成数据而无需额外工作。生成的合成数据在用于细化评估标准和与人类偏好一致度方面,效果不逊于手工精心制作的数据。这些发现表明,合成数据是一种有前景的替代方案,特别是在效率和可扩展性至关重要的情境下。
引用
@article{arxiv.2511.04478,
title = {Generate, Evaluate, Iterate: Synthetic Data for Human-in-the-Loop Refinement of LLM Judges},
author = {Hyo Jin Do and Zahra Ashktorab and Jasmina Gajcin and Erik Miehling and Martín Santillán Cooper and Qian Pan and Elizabeth M. Daly and Werner Geyer},
journal= {arXiv preprint arXiv:2511.04478},
year = {2025}
}
备注
29 pages, 4 figures