中文

SciIntBench:衡量 LLM 在对抗性框架下对科学研究完整性规范的遵从性

密码学与安全 2026-05-29 v1 人工智能

摘要

大型语言模型 (LLM) 越来越多地用于支持科学工作,但是否遵循负责任的科学研究 (RCR) 规范或帮助削弱这些规范尚不清晰。我们引入 SciIntBench,这是一个包含 810 个提示的对抗性基准测试,覆盖十个 RCR 类别和三个科学领域。每个情景以 Overt Adversarial、Covert Adversarial 和 Benign 三个版本呈现,允许我们同时衡量对违规行为的 framing-sensitive 拒绝以及对合法请求的帮助fulness。我们评估了 16 个商业和开源重量 LLM,来自六家提供商(2024--2026),产生了 12,960 个响应。我们发现科学完整性对齐 strongly framing-sensitive:模型对明确违规的拒绝远比对隐蔽违规更可靠,尤其是在将违规作为 pressure-driven 的捷径时表现较差。拒绝在 RCR 类别间存在差异,关于透明性、抄袭和造假的边界较弱。

关键词

引用

@article{arxiv.2605.29468,
  title  = {SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing},
  author = {Almene De Meran Meguimtsop and Maria Leonor Pacheco and Daniel E. Acuna},
  journal= {arXiv preprint arXiv:2605.29468},
  year   = {2026}
}