中文

LLM 过度敏感性的动态评估

计算与语言 2025-10-23 v1

摘要

当语言模型防御性地拒绝实际上无害的提示时,就会发生过度敏感。这种行为不仅会中断用户交互,还会模糊有害与无害内容之间的界限。现有基准依赖于随着模型演进会逐渐退化的静态数据集,导致数据污染和评估能力下降。为了解决这个问题,我们开发了一个框架,该框架动态生成特定于模型的挑战性数据集,捕获新兴的防御模式并与每个模型的独特行为保持一致。基于这种方法,我们构建了 OVERBENCH,这是一个聚合了不同 LLM 系列中这些数据集的基准,包含来自 25 个模型的 450,000 个样本。OVERBENCH 为过度敏感性提供了动态演进的视角,允许随着模型进步对防御触发因素进行持续监控,突出了静态数据集所忽略的漏洞。

关键词

引用

@article{arxiv.2510.19005,
  title  = {Dynamic Evaluation for Oversensitivity in LLMs},
  author = {Sophia Xiao Pu and Sitao Cheng and Xin Eric Wang and William Yang Wang},
  journal= {arXiv preprint arXiv:2510.19005},
  year   = {2025}
}

备注

EMNLP-Findings 2025