AutoChecklist:基于 LLM 判决器的可组合检查表生成与评分管线
计算与语言
2026-03-10 v1
摘要
检查表已成为可解释且细粒度评估方法中流行的选择,特别是针对LLM-as-a-Judge。除了评估之外,这些结构化标准还可作为模型对齐、强化学习和自我纠正的信号。为支持这些用例,我们present AutoChecklist,一个统一检查表评估为可组合管线的开源库。其核心是一个包含五种检查表生成抽象范式的分类体系,每种抽象编码了不同的得出评估准则的策略。一个模块化的Generator → Refiner → Scorer管线将任意生成器与统一评分器相连接,新配置仅通过提示模板即可注册。该库随附十个内置管线,实现了已发表的方法,并支持多个LLM提供商(OpenAI、OpenRouter、vLLM)。除了Python API外,库包括用于即插即用评估的CLI和用于交互式探索的Web界面。验证实验确认,这些检查表方法与人类偏好和质量评估显著一致,ICLR同行评审反驳案例的案例研究表明AutoChecklist在灵活的领域适应方面具有优势。AutoChecklist已公开于 https://github.com/ChicagoHAI/AutoChecklist。
引用
@article{arxiv.2603.07019,
title = {AutoChecklist: Composable Pipelines for Checklist Generation and Scoring with LLM-as-a-Judge},
author = {Karen Zhou and Chenhao Tan},
journal= {arXiv preprint arXiv:2603.07019},
year = {2026}
}
备注
Website: https://autochecklist.github.io/, Code: https://github.com/ChicagoHAI/AutoChecklist