中文

VisuoAlign:基于多模态树搜索的 LVLMs 安全对齐

人工智能 2025-10-21 v1 密码学与安全

摘要

大型视觉语言模型 (LVLMs) 在多模态感知和生成方面取得了显著进展,但其安全对齐仍是关键挑战。现有防御措施容易受到多模态越狱攻击,因为视觉输入引入了新的攻击面、推理链缺乏安全监督,而在模态融合下对齐往往下降。为克服这些限制,我们提出了 VisuoAlign,通过提示引导的树搜索实现多模态安全对齐框架。VisuoAlign 通过视觉-文本交互式提示将安全约束嵌入推理过程中,采用蒙特卡洛树搜索 (MCTS) 系统性构建多样化的安全关键提示轨迹,引入基于提示的比例放大以确保实时风险检测和合规响应。广泛实验表明,VisuoAlign 能主动暴露风险,实现全面的数据集生成,显著提高 LVLMs 针对复杂跨模态威胁的鲁棒性。

关键词

引用

@article{arxiv.2510.15948,
  title  = {VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search},
  author = {MingSheng Li and Guangze Zhao and Sichen Liu},
  journal= {arXiv preprint arXiv:2510.15948},
  year   = {2025}
}