中文

ConInstruct:评估大型语言模型在指令冲突检测与解决方面的能力

计算与语言 2025-11-20 v2

摘要

指令遵循是大型语言模型(LLM)的关键能力。虽然已有工作主要关注评估 LLM 遵循用户指令的程度,但常常忽视指令包含冲突约束的情况——这种情况在复杂提示中很常见。LLM 在此类条件下的行为尚未得到充分探索。为填补这一差距,我们引入 ConInstruct,一个专为评估 LLM 检测和解决用户指令中冲突能力而设计的基准测试。使用该数据集,我们评估了 LLM 的冲突检测性能并分析其冲突解决行为。我们的实验揭示了两个关键发现:(1)大多数专有 LLM 表现出强大的冲突检测能力,而在开源模型中,只有 DeepSeek-R1 展现出类似的强大性能。DeepSeek-R1 和 Claude-4.5-Sonnet 在平均 F1 分数上分别达到 91.5% 和 87.3%,在整体上名列第一和第二。(2)尽管 LLM 具备强大的冲突检测能力,但它们很少明确通知用户冲突或在面对冲突约束时请求澄清。这这些结果凸显了当前 LLM 的关键短comings,并为在设计遵循指令的 LLM 时指明了重要的改进方向。

关键词

引用

@article{arxiv.2511.14342,
  title  = {ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions},
  author = {Xingwei He and Qianru Zhang and Pengfei Chen and Guanhua Chen and Linlin Yu and Yuan Yuan and Siu-Ming Yiu},
  journal= {arXiv preprint arXiv:2511.14342},
  year   = {2025}
}

备注

Accepted to AAAI 2026