PARSE-Ego4D:基于元数据视频的个人动作推荐
计算机视觉与模式识别
2024-07-26 v2 人机交互
神经与进化计算
摘要
智能助理的工作不仅在于理解,还在于行动。现有的以自我为中心的视频数据集包含丰富的视频标注,但不包含智能助理在当下可执行的动作。为弥补这一差距,我们发布了 PARSE-Ego4D,这是一套针对 Ego4D 数据集的个人动作推荐标注。我们采用多阶段方法生成和评估这些标注。首先,我们使用提示工程化的大语言模型(LLM)生成情境感知的动作建议,并识别出超过 18,000 条动作建议。虽然这些合成动作建议很有价值,但大语言模型的内在局限性仍需人工评估。为确保高质量和以用户为中心的推荐,我们进行了大规模的人工标注研究,为 PARSE-Ego4D 提供了人类偏好的支撑。我们分析了评审人间的一致性,并评估了参与者的主观偏好。基于我们的数据集和完整的人工标注,我们提出了若干新的基于自我中心视频的动作建议任务。我们鼓励开发新解决方案以提高延迟和能源要求。PARSE-Ego4D 的标注将支持正在为增强现实和虚拟现实系统构建动作推荐系统的研究人员和开发者。
引用
@article{arxiv.2407.09503,
title = {PARSE-Ego4D: Personal Action Recommendation Suggestions for Egocentric Videos},
author = {Steven Abreu and Tiffany D. Do and Karan Ahuja and Eric J. Gonzalez and Lee Payne and Daniel McDuff and Mar Gonzalez-Franco},
journal= {arXiv preprint arXiv:2407.09503},
year = {2024}
}