中文

PerspectiveNet:用于动态场景理解的多视角感知

计算机视觉与模式识别 2025-07-22 v2 人工智能

摘要

从多个摄像机和视角生成详细描述面临视觉数据复杂且不一致的挑战。本文引入PerspectiveNet,一个轻量且高效的模型,用于跨多个摄像机视角生成长篇描述。该方法采用视觉编码器、紧凑的连接器模块将视觉特征转换为固定大小张量,以及大语言模型(LLM)以发挥LLM强大的自然语言生成能力。连接器模块旨在实现三个目标:将视觉特征映射至LLM嵌入、强调描述生成所需的关键信息,以及产生固定大小的特征矩阵。我们还辅以次要任务——正确帧序列检测,使模型能够搜索正确的帧序列以生成描述。最终将连接器模块、次要任务、LLM以及视觉特征提取模型集成为单一架构,针对交通安全描述与分析任务进行训练。该任务要求从多个摄像机和视角生成事件的详细、细粒度描述。所得模型轻量,确保高效训练与推理,同时保持高度有效。

关键词

引用

@article{arxiv.2410.16824,
  title  = {PerspectiveNet: Multi-View Perception for Dynamic Scene Understanding},
  author = {Vinh Nguyen},
  journal= {arXiv preprint arXiv:2410.16824},
  year   = {2025}
}

备注

6 pages, 2 figures