使用视觉语言模型量化人类视觉暴露组
人工智能
2026-05-06 v1 计算机视觉与模式识别
摘要
视觉环境是心理健康的一个基本但未被量化的决定因素。虽然环境暴露组的概念已确立,但当前的方法依赖于粗糙的地理空间代理或有偏差的自我报告,未能捕捉日常生活的第一人称视觉情境。我们通过将生态瞬时评估与视觉语言模型(VLMs)相结合来量化人类视觉体验的语义丰富度,从而填补了这一空白。在 2674 张参与者生成的照片中,VLM 推导的绿度估计值稳健地预测了瞬时情绪和慢性压力,与既定基准一致。随后,我们开发了一个基于大型语言模型(LLM)的半自主流水线,挖掘了超过七百万篇科学出版物,以提取近 1000 个与心理健康有经验联系的环境特征。当应用于真实世界图像时,高达 33% 的 VLM 提取的情境评级与情绪和压力显著相关。这些发现为视觉暴露组学建立了一个可扩展的客观范式,实现了对可见世界如何与心理健康相关联的高通量解码。
引用
@article{arxiv.2605.03863,
title = {Quantifying the human visual exposome with vision language models},
author = {Christian Rominger and Andreas R. Schwerdtfeger and Malay Gaherwar Singh and Dimitri Khudyakow and Elizabeth A. M. Michels and Fabian Wolf and Jakob Nikolas Kather and Magdalena Katharina Wekenborg},
journal= {arXiv preprint arXiv:2605.03863},
year = {2026}
}