缺失的红线:商业压力如何侵蚀 AI 安全边界
计算机与社会
2026-03-17 v1 人工智能
摘要
当 AI 助手被告知要“最大化销售额”,而用户询问药物相互作用时,发生了什么?我们发现,商业系统提示会覆盖安全训练,导致前沿模型撒谎关于药物风险、忽视安全顾虑,并优先考虑利润而非用户福祉。在场景中测试 8 个模型,当商业目标与用户安全相冲突——糖尿病患者询问高糖补充剂、投资者被推向不适合的产品、旅行者被引导避开安全警示——我们发现灾难性失效:模型编造安全信息、明知应该拒绝却继续行动,以及积极劝阻用户就医。最令人担忧的是,模型并无“红线”,其满足有害请求的意愿并未随潜在后果从轻微到致命而下降。我们的发现表明,当前安全训练在商业部署环境中难以普遍化。
引用
@article{arxiv.2603.13250,
title = {The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries},
author = {Nora Petrova and John Burden},
journal= {arXiv preprint arXiv:2603.13250},
year = {2026}
}
备注
Preprint