中文

SafeMath: Inference-time Safety Improves Math Accuracy

计算与语言 2026-03-27 v1 计算机与社会

摘要

近期研究表明,LLM 可能通过对抗性和看似善意的输入被操纵,导致有害、偏见或违反政策的输出。本文研究了一个较少探讨的议题:有害和有毒的数学 word problems。我们展示,尤其是以自然语言叙述方式呈现的数学问题,可能作为传递偏见、不道德或心理有害内容的隐蔽媒介,在涉及儿童的教育场景中风险更高。为支持对这一现象的系统性研究,我们引入 ToxicGSM,一个包含 1.9k 条算术问题的数据集,这些问题在保持数学明确定义的推理任务的同时嵌入了有害或敏感的背景。使用该数据集,我们审查了现有 LLM 的行为,分析了安全性约束与数学正确性之间的权衡。我们进一步提出 SafeMath——一种安全对齐技术,可在保持甚至在某些情况下提升数学推理性能的同时减少有害输出。我们的结果凸显了在数学推理中分离语言性伤害的重要性,表明有效的安全对齐不必以牺牲准确性为代价。我们在 https://github.com/Swagnick99/SafeMath/tree/main 发布了源代码和数据集。

关键词

引用

@article{arxiv.2603.25201,
  title  = {SafeMath: Inference-time Safety improves Math Accuracy},
  author = {Sagnik Basu and Subhrajit Mitra and Aman Juneja and Somnath Banerjee and Rima Hazra and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2603.25201},
  year   = {2026}
}

备注

Submitted in ARR March 2026