中文

迷失在翻译中?复合危害跨语言迁移的比较研究

计算与语言 2026-02-10 v1 人工智能

摘要

大多数大型语言模型(LLM)的安全评估仍以英语为主。翻译常被用作探索多语言行为的捷径,但它很少能捕捉到全貌,尤其是当有害意图或结构在不同语言间发生变形时。某些类型的危害在翻译后几乎完整保留,而其他类型则会扭曲或消失。为了研究这种效应,我们引入了 CompositeHarm,这是一个基于翻译的基准,旨在考察安全对齐在句法和语义均发生变化时的表现。它结合了两个互补的英文数据集:针对结构化对抗性攻击的 AttaQ,以及涵盖上下文性、现实世界危害的 MMSafetyBench,并将它们扩展到六种语言:英语、印地语、阿萨姆语、马拉地语、卡纳达语和古吉拉特语。使用三个大型模型,我们发现攻击成功率在印度语言中急剧上升,尤其是在对抗性句法下,而上下文性危害的迁移则更为温和。为了确保可扩展性和能效,我们的研究采用了受边缘AI设计原理启发的轻量级推理策略,在保持跨语言保真度的同时,减少了冗余的评估轮次。这种设计使得大规模多语言安全测试在计算上可行且环境友好。总体而言,我们的结果表明,翻译后的基准是构建扎实的、资源感知的、语言自适应安全系统的必要第一步,但并非充分条件。

关键词

引用

@article{arxiv.2602.07963,
  title  = {Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms},
  author = {Vaibhav Shukla and Hardik Sharma and Adith N Reganti and Soham Wasmatkar and Bagesh Kumar and Vrijendra Singh},
  journal= {arXiv preprint arXiv:2602.07963},
  year   = {2026}
}

备注

Accepted at the AICS Workshop, AAAI 2026