面向多种计算机视觉任务的近原始说话者头部视频数据集
计算机视觉与模式识别
2026-03-31 v1 多媒体
图像与视频处理
摘要
说话者头部视频是实时通信中主要的内容类型,但公开用于视频处理研究的数据集在信号保真度方面仍显稀缺且受限。本文开源一套近原始数据集,包含847段说话者录制视频(约212分钟),每段时长为15秒,来自805名参与者,使用846台独立消费级摄像头设备在自然环境中录制。所有录制采用FFV1无损编码存储,保留相机原始信号——未压缩(24.4%)或MJPEG编码(75.6%),且无额外有损处理。每段录制标注了均值主观评分(MOS)及十个感知质量标记,联合解释MOS方差的64.4%。从该语料库中,我们精选了包含120段视频的分层基准子集,涵盖原始、背景模糊及背景替换三种内容条件。对四大编码器(H.264、H.265、H.266、AV1)在四个数据集上的编码器效率评估显示,H.266相较于H.264可实现最高-71.3%的BD-rate节省,编码器×数据集()与编码器×内容条件()之间的显著交互作用表明,内容类型与背景处理均显著影响压缩效率。该数据集规模是当前最大的说话者 webcam 数据集(847 vs. 160段)的5倍,具备无损信号保真度,为训练与基准测试面向实时通信的视频压缩与增强模型提供了资源。
引用
@article{arxiv.2603.26763,
title = {A Near-Raw Talking-Head Video Dataset for Various Computer Vision Tasks},
author = {Babak Naderi and Ross Cutler},
journal= {arXiv preprint arXiv:2603.26763},
year = {2026}
}