面向内置隐私的单像素视觉语言模型用于行为智能
计算机视觉与模式识别
2026-01-27 v1 人工智能
摘要
不良社交互动,如欺凌、骚扰及其他非法活动,构成对个人福祉和公共安全的重大威胁,对身心健康造成深远影响。然而,这些关键事件常发生在浴室、更衣室等隐私敏感场所,传统监控在此类环境中受严格隐私法规和伦理顾虑的限制。本文提出单像素视觉语言模型(SP-VLM),一种重新构想安全环境监控的新框架。它通过捕获单像素模态中天然低维的人类动态,实现内置隐私设计,进而通过无缝视觉语言集成推断复杂行为模式。我们展示,单像素感知本质上抑制了身份可恢复性,在关键采样率以下使最先进的人脸识别系统均无效。进一步表明,SP-VLM仍可从严重退化的单像素观测中提取有意义的行为语义,实现鲁棒的异常检测、人数统计和活动理解。将这些发现相结合,我们识别了在行为智能涌现而个人身份保持强隐私的实用采样率范围。这些结果指向了一条符合人权原则的安全监控路径,支持及时干预,而不正规化隐私敏感空间的侵入性监控。
引用
@article{arxiv.2601.17050,
title = {Single-Pixel Vision-Language Model for Intrinsic Privacy-Preserving Behavioral Intelligence},
author = {Hongjun An and Yiliang Song and Jiawei Shao and Zhe Sun and Xuelong Li},
journal= {arXiv preprint arXiv:2601.17050},
year = {2026}
}
备注
Initial Version, Pending Updates. We welcome any feedback and suggestions for improvement. Please feel free to contact us at [email protected]