SciIntBench:衡量 LLM 在对抗性框架下对科学研究完整性规范的遵从性
密码学与安全
2026-05-29 v1 人工智能
摘要
大型语言模型 (LLM) 越来越多地用于支持科学工作,但是否遵循负责任的科学研究 (RCR) 规范或帮助削弱这些规范尚不清晰。我们引入 SciIntBench,这是一个包含 810 个提示的对抗性基准测试,覆盖十个 RCR 类别和三个科学领域。每个情景以 Overt Adversarial、Covert Adversarial 和 Benign 三个版本呈现,允许我们同时衡量对违规行为的 framing-sensitive 拒绝以及对合法请求的帮助fulness。我们评估了 16 个商业和开源重量 LLM,来自六家提供商(2024--2026),产生了 12,960 个响应。我们发现科学完整性对齐 strongly framing-sensitive:模型对明确违规的拒绝远比对隐蔽违规更可靠,尤其是在将违规作为 pressure-driven 的捷径时表现较差。拒绝在 RCR 类别间存在差异,关于透明性、抄袭和造假的边界较弱。
引用
@article{arxiv.2605.29468,
title = {SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing},
author = {Almene De Meran Meguimtsop and Maria Leonor Pacheco and Daniel E. Acuna},
journal= {arXiv preprint arXiv:2605.29468},
year = {2026}
}