DIALEVAL:基于类型论的 LLM 指令遵循自动化评估
计算与语言
2026-03-05 v1 人工智能
摘要
评估大型语言模型(LLM)的指令遵循能力需要将指令分解为可验证的要求并评估满足情况——目前这类任务依赖手动标注且标准化准则与人类判断模式不符。我们提出了 DIALEVAL,一种基于类型论的框架,通过双 LLM 智能体实现指令分解为类型化谓词并实现类型特定的满足语义。该框架在自动化提取过程中强制执行形式化的原子性和独立性约束,然后应用差异化评估准则——内容谓词采用语义等价、数值谓词采用精确匹配——模拟了实证观察到的人类评估模式。通过历史感知的满足函数扩展至多轮对话,DIALEVAL 能够在单轮方法失效的对话情境中进行评估。验证结果表明,DIALEVAL 在复杂指令上的准确率达 90.38%(相较于基线降低 26.45% 错误),且与人类判断的相关性显著提升。
引用
@article{arxiv.2603.03321,
title = {DIALEVAL: Automated Type-Theoretic Evaluation of LLM Instruction Following},
author = {Nardine Basta and Dali Kaafar},
journal= {arXiv preprint arXiv:2603.03321},
year = {2026}
}
备注
PAKDD 2026