中文

CompliBench:用于对话系统中合规违规检测的LLM评判基准

计算与语言 2026-04-15 v1

摘要

随着大型语言模型(LLM)在企业环境中日益部署作为任务导向型代理,确保其严格遵守复杂、领域特定的运营准则至关重要。虽然利用LLM-as-Judge作为可扩展评估解决方案前景光明,但这些评判器在检测特定政策违规方面的可靠性仍鲜有探讨。这一差距主要源于缺乏系统性的数据生成方法,这受限于细粒度人工标注的高成本以及合成真实代理违规的困难。本文引入CompliBench,一个新型基准,用于评估LLM评判器检测多轮对话中违反指南的能力。为克服数据稀缺问题,我们开发了可扩展的自动化数据生成管道,模拟用户与代理人之间的交互。我们的可控缺陷注入过程自动产生被违反指南的精确真实标签以及确切对话轮次,而对抗搜索方法确保这些引入的扰动具有高度挑战性。我们的全面评估显示,当前最先进的专有LLM在此任务上表现显著不足。此外,我们证明,在合成数据上微调的小规模评判模型超越了领先LLM,并能良好地推广到未见的业务领域,凸显了我们的管道作为训练鲁棒生成奖赏模型的有效基础。

关键词

引用

@article{arxiv.2604.12312,
  title  = {CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems},
  author = {Jingbo Yang and Guanyu Yao and Bairu Hou and Xinghan Yang and Nikolai Glushnev and Iwona Bialynicka-Birula and Duo Ding and Shiyu Chang},
  journal= {arXiv preprint arXiv:2604.12312},
  year   = {2026}
}