从视频中有效获取声学、视觉和文本数据
计算机视觉与模式识别
2025-09-09 v1
摘要
随着机器学习模型的不断使用,针对高质量大规模多模态数据集的需求日益增长。然而,尤其是那些结合声学、视觉和文本数据的数据集的可用性仍有限。本文通过提出一种从视频中提取相关音频-图像-文本观察值的方法来弥补这一差距。我们详细阐述了选择合适视频、提取相关数据对和使用图像到文本模型生成描述性文本的过程。该方法确保了各模态之间具有稳健的语义联系,从而提高了创建数据集的实用性,以支持各种应用。我们还讨论了遇到的挑战并提出了改进数据质量的解决方案。所得数据集已公开发布,旨在支持和推动多模态数据分析和机器学习研究的进展。
关键词
引用
@article{arxiv.2509.05785,
title = {CRAB: Camera-Radar Fusion for Reducing Depth Ambiguity in Backward Projection based View Transformation},
author = {In-Jae Lee and Sihwan Hwang and Youngseok Kim and Wonjune Kim and Sanmin Kim and Dongsuk Kum},
journal= {arXiv preprint arXiv:2509.05785},
year = {2025}
}
备注
Accepted by ICRA 2025