一种面向设备端人类行为理解的、由大语言模型赋能的低分辨率视觉系统
计算机视觉与模式识别
2025-05-06 v1 人工智能
机器学习
摘要
大型视觉语言模型(LVLMs)的快速发展,使其有潜力超越传统标注,为低分辨率视觉系统(如深度、热成像和红外)中的设备端人类行为理解(HBU)生成更丰富、更详细的描述。然而,现有的大型视觉语言模型(LVLM)方法无法很好地理解低分辨率数据,因为它们主要针对高分辨率数据(如RGB图像)设计。一种快速的修复方法是为大量低分辨率数据添加字幕,但这需要大量劳动密集型的标注工作。在本文中,我们提出了一种新颖的、节省人力的系统,名为Llambda,旨在支持低分辨率HBU。其核心思想是利用有限的标注数据和大量未标注数据来引导LLM生成信息丰富的字幕,这些字幕可与原始数据结合,有效微调LVLM模型以理解HBU中的低分辨率视频。首先,我们提出了一种面向对比的数据标注器,它能够从长时低分辨率视频中捕获与行为相关的信息,并通过对比学习为未标注数据生成高质量的伪标签。其次,我们提出了一种物理知识引导的字幕生成器,它利用空间和时间一致性检查来减轻伪标签中的错误。因此,它可以提高LLM对序列数据的理解,然后生成高质量的视频字幕。最后,为确保设备端可部署性,我们采用基于LoRA的高效微调来使LVLM适应低分辨率数据。我们使用一个区域规模的现实世界测试平台和三个不同的低分辨率数据集对Llambda进行了评估,实验表明,Llambda在平均Bert-Score上优于多个最先进的LVLM系统,最高可达40.03%。
引用
@article{arxiv.2505.01743,
title = {An LLM-Empowered Low-Resolution Vision System for On-Device Human Behavior Understanding},
author = {Siyang Jiang and Bufang Yang and Lilin Xu and Mu Yuan and Yeerzhati Abudunuer and Kaiwei Liu and Liekang Zeng and Hongkai Chen and Zhenyu Yan and Xiaofan Jiang and Guoliang Xing},
journal= {arXiv preprint arXiv:2505.01743},
year = {2025}
}