中文

对抗人文学基准:前沿模型安全中的风格鲁棒性结果

计算机视觉与模式识别 2026-05-12 v3 计算与语言 机器人学

摘要

对抗人文学基准 (Adversarial Humanities Benchmark, AHB) 评估模型安全拒绝是否能抵御从熟悉有害提示形式转向的冲击。该基准从 MLCommons AILuminate 中抽取的有害任务,通过保持意图不变的方式进行人文学风格改写。该基准扩展了 Adversarial Poetry 和 Adversarial Tales 文献,从单一的越狱操作者扩展到更广泛的风格遮蔽和目标隐蔽化基准系列。在此报告的基准结果中,原始攻击记录 3.84% 的攻击成功率 (ASR),而转换后方法的范围为 36.8% 到 65.0%,在 31 个前沿模型中实现了 55.75% 的总体 ASR。就欧盟 AI 法案 Code-of-Practice 启发的系统风险视角而言,化学、生物、放射和核 (CBRN) 是最高的分类。总体而言,这种缺乏风格鲁棒性表明当前的安全技术存在弱泛化问题:对“非恶意”的深层理解仍是前沿模型安全中尚未解决的核心问题。

关键词

引用

@article{arxiv.2604.18486,
  title  = {Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation},
  author = {Jinghui Lu and Jiayi Guan and Zhijian Huang and Jinlong Li and Guang Li and Lingdong Kong and Yingyan Li and Han Wang and Shaoqing Xu and Yuechen Luo and Fang Li and Chenxu Dang and Junli Wang and Tao Xu and Jing Wu and Jianhua Wu and Xiaoshuai Hao and Wen Zhang and Tianyi Jiang and Lingfeng Zhang and Lei Zhou and Yingbo Tang and Jie Wang and Yinfeng Gao and Xizhou Bu and Haochen Tian and Yihang Qiu and Feiyang Jia and Lin Liu and Yigu Ge and Hanbing Li and Yuannan Shen and Jianwei Cui and Hongwei Xie and Bing Wang and Haiyang Sun and Jingwei Zhao and Jiahui Huang and Pei Liu and Zeyu Zhu and Yuncheng Jiang and Zibin Guo and Chuhong Gong and Hanchao Leng and Kun Ma and Naiyan Wang and Guang Chen and Kuiyuan Yang and Hangjun Ye and Long Chen},
  journal= {arXiv preprint arXiv:2604.18486},
  year   = {2026}
}

备注

Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl