中文

GrandJury:面向动态质量评分准则的协作式机器学习模型评估协议

机器学习 2025-08-08 v2 人工智能 人机交互

摘要

生成式机器学习模型已成为现代系统的核心,为创意写作、摘要生成、多跳推理和上下文感知对话等应用提供支持。这些模型支撑着大规模 AI 助手、工作流自动化和自主决策。在这些领域中,可接受的响应很少是绝对的或静态的,而是多元的且高度依赖上下文的。然而,标准的评估机制仍然依赖于静态的基准测试,促使模型针对排行榜分数进行优化,而非与动态的用户需求或不断变化的现实保持一致。GrandJury 引入了一种正式的评估协议,结合了时间衰减聚合、完全可追溯性,并支持动态、透明的任务评分准则归因以及多评估者人类判断。这些要素共同实现了多元、可问责的评估,能够捕捉不断演变的共识并揭示分歧。我们提供了开源实现(grandjury PyPI 包)以及一个公开的大型语言模型(LLM)推理输出集合,以说明其需求和方法。GrandJury 为 AI 从业者在没有绝对真值的情况下评估机器学习输出提供了一种新范式。

关键词

引用

@article{arxiv.2508.02926,
  title  = {GrandJury: A Collaborative Machine Learning Model Evaluation Protocol for Dynamic Quality Rubrics},
  author = {Arthur Cho},
  journal= {arXiv preprint arXiv:2508.02926},
  year   = {2025}
}

备注

14 pages (incl. arXiv cover), 1 table, code & dataset links inside. Open-source implementation available on PyPI (grandjury package) and GitHub. Dataset available on Hugging Face under CC-BY-4.0 license