中文

SafeVid:面向安全对齐的视频大型多模态模型

计算机视觉与模式识别 2025-05-20 v1 人工智能

摘要

随着视频大型多模态模型(VLMMs)的快速发展,其内在复杂性引入了显著的安全挑战,尤其是静态安全对齐难以迁移到动态视频情境的通用性失配问题。我们提出SafeVid,一个旨在为VLMMs灌输视频特定安全原则的框架。SafeVid通过采用详细的文本视频描述作为解释性桥梁,将鲁棒的文本安全对齐能力传输到视频领域,从而实现基于LLM的规则驱动安全推理。为实现这一目标,SafeVid构建了一个闭环系统,包括:1)生成SafeVid-350K,我们的一种新型350,000对视频特定安全偏好数据集;2)使用直接偏好优化(DPO)针对VLMMs进行对齐;3)通过我们新的SafeVidBench基准进行全面评估。与SafeVid-350K对齐显著提升了VLMM的安全性能,诸如LLaVA-NeXT-Video模型在SafeVidBench上实现了显著提升(例如提升至42.39%)。SafeVid提供了关键资源和结构化方法,表明利用文本描述作为安全推理的中介可显著改善VLMM的安全对齐。我们已将SafeVid-350K数据集(https://huggingface.co/datasets/yxwang/SafeVid-350K)公开。

关键词

引用

@article{arxiv.2505.11926,
  title  = {SafeVid: Toward Safety Aligned Video Large Multimodal Models},
  author = {Yixu Wang and Jiaxin Song and Yifeng Gao and Xin Wang and Yang Yao and Yan Teng and Xingjun Ma and Yingchun Wang and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2505.11926},
  year   = {2025}
}