VideoASMR-Bench: AI 生成的 ASMR 视频能否欺骗 VLM 和人类?
计算机视觉与模式识别
2026-05-08 v4
摘要
随着 AI 生成的视频越来越难以与真实视频区分,当前基准主要关注广泛的语义对齐和基本物理一致性,为评估它们提供的判别能力有限。为解决这一问题,我们引入了 VideoASMR-Bench,一个基于自发性知觉经络反应(ASMR)视频的基准,强调细粒度的音频-视觉感知和感官沉浸。该基准旨在回答两个关键问题:(i) 当今的视频理解模型(VLMs)是否足够敏感,能通过识别微小的视觉、物理或听觉伪影来检测 AI 生成的 ASMR 视频?(ii) 当今的视频生成模型(VGMs)能否生成具有沉浸式体验的令人信服的 ASMR 视频?该基准包含来自社交媒体的 1500 个高质量真实 ASMR 视频,以及由九个 VGMs 生成的 2235 个合成对应视频。此外,我们开源了一套可扩展的提示和参考图像,使基准能够随未来视频模型动态扩展。此外,我们设计了一个 VGM 与 VLM 之间的自动理解-生成评估框架,其中 VGMs 旨在生成逼真的虚假视频以欺骗 VLMs,而 VLMs 则试图检测它们,形成双方之间的对抗博弈。我们在 VideoASMR-Bench 上的评估表明,即使是最先进的 VLMs(如 Gemini-3-Pro)也无法可靠地检测 AI 生成的 ASMR 视频。与此同时,当前前沿视频生成模型可以生成 VLMs 难以与真实视频区分的 ASMR 视频,而人类仍然相对容易地识别它们。
引用
@article{arxiv.2512.13281,
title = {VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?},
author = {Jiaqi Wang and Weijia Wu and Yi Zhan and Rui Zhao and Ming Hu and James Cheng and Wei Liu and Philip Torr and Kevin Qinghong Lin},
journal= {arXiv preprint arXiv:2512.13281},
year = {2026}
}
备注
Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/