由人类种子驱动的自演化对话评估框架 GrowLoop
计算与语言
2026-05-29 v1 人工智能
声音
摘要
随着大语言模型的快速发展,对开放式对话中人类模拟性的评估日益重要。然而,人类模拟性是一种潜在知识,人类直观感知,但其背后的标准难以明确表述。人类判断在某些案例上意见一致,但在另一些案例上存在合法分歧。此外,人类判断背后的标准仍是隐式的,缺乏明确的案例构建依据。进一步,何为人类化是动态的,随着模型能力和人类期望的演变而变化。尽管已有专家构建的基准、奖励模型和自演化基准在各自方面取得进展,但尚无方法能同时解决上述三个挑战。因此,我们提出 GrowLoop:一个自演化对话评估系统,随模型进步和情景变迁持续适应。以最小的人类种子注释为首要驱动,LLM 代理通过 Heuristic Learning 持续提取并细化评估准则。要求在人类注释收敛的地方实现人机一致性,而在分歧的地方仅需满足合理性。此外,Rubric-Case 共演机制实现持续演化,新增种子可扩展评估目标。应用于开放式对话的人类模拟性评估,生成的评估准则不仅在与人类判断一致性方面显著优于现有方法,还能揭示注释者忽视的问题。 resulting benchmark 有效区分不同能力层级的模型,揭示其局限,同时可推广至新情景并随模型演进自适应。我们的工作将基准测试范式从手动更新或难度扩展,转向全面、持续的自演化。
引用
@article{arxiv.2605.28882,
title = {GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human},
author = {Yihang Lin and Yunze Gao and Zeyang Lin and Dongbo Li and Kun Peng and Chenglong Song and Yue Liu},
journal= {arXiv preprint arXiv:2605.28882},
year = {2026}
}