MortalMATH:评估推理目标与紧急情境之间的冲突
计算与语言
2026-01-27 v1
摘要
大型语言模型正日益针对深度推理进行优化,将复杂任务的正确执行置于一般对话之上。我们研究这种对计算的关注是否会造成忽视关键情况安全的“隧道视野”。我们引入了 MortalMATH,这是一个包含 150 个场景的基准测试,其中用户请求代数帮助,同时描述了越来越危及生命的紧急情况(例如中风症状、自由落体)。我们发现了一种显著的行为分化:通用模型(如 Llama-3.1)成功拒绝了数学问题以应对危险。相比之下,专门的推理模型(如 Qwen-3-32b 和 GPT-5-nano)通常完全忽略紧急情况,在用户描述自己垂死之际仍保持超过 95% 的任务完成率。此外,推理所需的计算时间引入了危险的延迟:在提供任何潜在帮助之前长达 15 秒。这些结果表明,训练模型不懈追求正确答案可能会无意中遗忘安全部署所需的生存本能。
引用
@article{arxiv.2601.18790,
title = {MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts},
author = {Etienne Lanzeray and Stephane Meilliez and Malo Ruelle and Damien Sileo},
journal= {arXiv preprint arXiv:2601.18790},
year = {2026}
}