JT-Safe-V2:面向企业智能体的安全设计基础模型
人工智能
2026-05-26 v1
摘要
我们介绍了JT-Safe-V2,这是一个大型语言模型,旨在推进基础模型的安全性和可信度,延续了我们先前的JT-Safe模型,朝着更全面的安全设计范式迈进。JT-Safe-V2强调通过以下几项关键创新实现通用智能与安全设计的联合优化:丰富预训练数据中的情境世界知识、高确定性预训练程序以及面向企业智能体能力的安全强化后训练机制。在这些安全增强的基础模型之上,我们提出了Safe-MoMA(安全混合模型与智能体),该框架通过协调部署多个模型和智能体实现可追溯且高效的推理。广泛的评估表明,JT-Safe-V2在通用智能和安全基准测试中均实现了最先进的性能。此外,Safe-MoMA相较于使用最大独立模型基线,能够将推理成本降低超过30%,同时保持相当的性能。为促进面向安全设计基础模型的未来研究,我们公开发布了经过后训练的JT-Safe-V2-35B模型检查点。
引用
@article{arxiv.2605.24414,
title = {JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data},
author = {Junlan Feng and Fanyu Meng and Chong Long and Pengyu Cong and Duqing Wang and Yan Zheng and Yuyao Zhang and Xuanchang Gao and Ye Yuan and Yunfei Ma and Zhijie Ren and Fan Yang and Na Wu and Di Jin and Chao Deng},
journal= {arXiv preprint arXiv:2605.24414},
year = {2026}
}