中文

Pluralistic Behavior Suite:对多轮行为政策遵循进行压力测试

计算与语言 2025-11-10 v1 人工智能 机器学习

摘要

大型语言模型(LLMs)通常被对齐到旨为广泛公众可接受性而设定的通用安全和使用原则。然而,LLMs的实际应用往往发生在由独特企业政策、监管要求、具体用例、品牌指南和伦理承诺所塑造的组织生态系统中。这一现实凸显了对LLMs进行严格且全面的评估的必要性,以适应多元化对齐目标,即一种强调适应不同用户价值和需求的对齐范式。在本工作中,我们提出了PLURALISTIC BEHAVIOR SUITE(PBSUITE),一个动态评估套件,旨在系统性地评估LLMs在多轮交互式对话中遵循多元化对齐规范的能力。PBSUITE包括(1)300个现实可信的LLM行为政策数据集,基于30个行业;以及(2)用于在对抗性条件下压力测试模型对自定义行为规范合规性的动态评估框架。使用PBSUITE,我们发现领先的开源和闭源LLMs在单轮设置下(错误率不足于4%)保持着稳健的行为政策遵循,但在多轮对抗性互动中(错误率可达84%)的合规性显著下降。这些发现凸显了现有的模型对齐和安全 moderation 方法在实际LLM交互中不足以在连贯地强制执行多元化行为政策。我们的工作为未来研究提供了支持robust和情境感知的多元化对齐技术的数据集和分析框架。

关键词

引用

@article{arxiv.2511.05018,
  title  = {Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies},
  author = {Prasoon Varshney and Makesh Narsimhan Sreedhar and Liwei Jiang and Traian Rebedea and Christopher Parisien},
  journal= {arXiv preprint arXiv:2511.05018},
  year   = {2025}
}

备注

Accepted at the Multi-Turn Interactions workshop at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)