发育与行为科学中的开放视频数据共享
计算机视觉与模式识别
2023-03-24 v1 人工智能
摘要
视频记录是研究及临床实践中记录婴儿和儿童行为的广泛使用的方法。尽管对共享大规模数据集的需求持续增长,但由于保密性的伦理顾虑,视频数据极少被共享。当涉及数据驱动的基于计算机的方法(如补充临床评估的筛查工具)时,这一需求更为迫切。为了在共享数据的同时遵守隐私保护规则,一个关键问题随之产生:数据去标识化的努力是否会降低数据效用?我们通过展示 Prechtl 全身运动评估(GMA)——一种已确立且全球实践的基于视频的婴儿早期神经缺陷(如脑瘫)诊断工具——来解答该问题。迄今为止,尚不存在用于婴儿运动分析的共享专家标注大规模数据存储库。此类数据集将极大有益于人类评估者的训练与重新校准,以及基于计算机的方法的开发。在当前研究中,从一个前瞻性的纵向婴儿队列中随机选取总计 19451 个可用的全身运动视频片段,用于人类临床推理和基于计算机的分析。我们首次证明,通过人脸模糊化视频记录实现的假名化是一种可行方法。视频编辑并未影响人类评估者或计算机视觉方法的分类准确率,表明其为共享运动视频数据提供了一种充分且易于应用的解决方案。我们呼吁在运动评估之外的科学和临床领域,进一步探索高效且符合隐私规则的视频数据去标识化方法。这些方法应能够实现独立视频数据集的共享与合并,形成大型数据池,以推进科学与公共卫生。
引用
@article{arxiv.2207.11020,
title = {Open video data sharing in developmental and behavioural science},
author = {Peter B Marschik and Tomas Kulvicius and Sarah Flügge and Claudius Widmann and Karin Nielsen-Saines and Martin Schulte-Rüther and Britta Hüning and Sven Bölte and Luise Poustka and Jeff Sigafoos and Florentin Wörgötter and Christa Einspieler and Dajie Zhang},
journal= {arXiv preprint arXiv:2207.11020},
year = {2023}
}