FANVID:低分辨率视频中的人脸与车牌识别基准
计算机视觉与模式识别
2026-02-12 v2
摘要
现实监控场景下,单个低分辨率(LR)帧中的人脸和车牌往往难以被识别,限制了可靠的身份识别。为推动基于时间的识别模型,本文提出FANVID,一个新颖的视频基准数据集,包含约1,463个LR剪辑(180×320,20-60 FPS),涵盖63个身份和49个车牌,来自三个英语国家。每个视频均包含干扰性人脸和车牌,以提升任务难度和真实性。数据集包含31,096个经过人工验证的边界框和标签。FANVID定义两个任务:(1)人脸匹配——检测LR人脸并将其匹配到高分辨率照片;(2)车牌识别——从LR车牌中提取文本,无需预定义数据库。视频经下采样自高分辨率来源,确保单帧中人脸和文字无法辨认,要求模型利用时间信息。我们引入适用于均值平均精度(mAP)于IoU>0.5的评估指标,优先考虑人脸的身份正确性和文本的字符级准确性。采用预训练视频超分辨率、检测和识别的基线方法,分别获得0.58(人脸匹配)和0.42(车牌识别)的性能得分,凸显了任务的可行性与挑战性。FANVID所选人脸和车牌在多样性与识别难度之间取得平衡。我们发布软件以支持数据访问、评估、基线方法及标注,以促进可重复性和延伸。FANVID旨在催化低分辨率识别中时间建模的创新,适用于监控、司法鉴定和自动驾驶领域。
引用
@article{arxiv.2506.07304,
title = {FANVID: A Benchmark for Face and License Plate Recognition in Low-Resolution Videos},
author = {Kavitha Viswanathan and Vrinda Goel and Shlesh Gholap and Devayan Ghosh and Madhav Gupta and Dhruvi Ganatra and Sanket Potdar and Amit Sethi},
journal= {arXiv preprint arXiv:2506.07304},
year = {2026}
}