中文

ReVision:面向隐私保护任务导向视觉指令重写的数据集与基线 VLM

计算与语言 2026-01-28 v3 人工智能 计算机视觉与模式识别

摘要

随着 AR、VR 以及具备强大摄像头的现代智能手机成为人机交互的主要界面,高效且隐私保护的多模态交互变得至关重要。现有的强大大型视觉语言模型(VLM)通常依赖云端处理,引发显著隐私顾虑(1)通过传输敏感视觉数据至服务器导致视觉隐私受损,(2)其实际时效性和本地可用性受限。本文探索视觉指令重写技术,这是一种新方法,将多模态指令转化为仅含文本的命令,使轻量级本地指令重写 VLM(250 万参数)能够无缝集成到现有对话式 AI 系统中,从而增强视觉数据隐私。为实现此目标,我们构建了超过 39,000 个示例的数据集,覆盖 14 个领域,并开发了一个紧凑型 VLM,该模型在图像描述数据集上进行预训练,然后针对指令重写进行微调。实验结果通过 BLEU、METEOR 和 ROUGE 等 NLG 指标,以及语义解析分析表明,即使是量化版本的模型(<500MB 存储占用)也能实现有效的指令重写,从而支持面向隐私的多模态 AI 应用。

关键词

引用

@article{arxiv.2502.14780,
  title  = {ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting},
  author = {Abhijit Mishra and Mingda Li and Hsiang Fu and Richard Noh and Minji Kim},
  journal= {arXiv preprint arXiv:2502.14780},
  year   = {2026}
}

备注

In Proceedings of the IJCNLP-AACL 2025